← 首页
端到端自动驾驶 · 文献梳理 · 2026-09

端到端规划技术谱系

整理于 2026-09-29 · 2026-09-30 增补扩展线

规划的三条主线是同一个闭环里的三个环节:生成器提出候选轨迹,打分器评估候选(用于选择,也可作奖励),RL 后训练再用奖励把生成器推向高质量区域。主线之外补了六条扩展线:输入侧的感知与场景表示,训练侧的模仿与蒸馏、世界模型,模型形态上的 VLA,以及验证侧的捷径与时序一致性、评测。每条线都按“核心问题 → 关键公式 → 代表论文”组织。

Overview

线路总览

端到端模型本质是一个策略 \(\tau^{*}=\pi_\theta(\cdot\mid o)\)。九条线分别回答它的四层问题:看什么(\(o\) 的表示)、怎么决策(\(\pi\) 怎么出轨迹、怎么选)、用什么信号学(\(\theta\) 怎么训练)、学对了没有。

层线核心问题
输入 · 看什么⓪ 感知与场景表示表示单元是位置(稠密 BEV)还是物体(稀疏 query);二段式是感知冻结、接口量化的极端情况
决策 · 怎么出轨迹① 轨迹生成输出参数化、多模态机制、推理步数
决策 · 怎么选② 打分 / 选择打分器的监督从哪来:离 GT 的距离,还是规则子指标
训练 · 奖励信号③ RL / 后训练奖励从哪来、用什么算法、单步开环还是真闭环
训练 · 教师信号④ 模仿与蒸馏怎样让学生在自己犯错后的状态上得到纠正
训练 · 自监督⑤ 世界模型预测未来能否弥补轨迹监督的稀疏;能否当环境和评论家
决策 · 模型形态⑥ VLA大模型负责理解与推理,动作专家出轨迹;上车还是当云端教师
验证 · 诊断⑦ 捷径与时序一致性模型是否在外推自车状态;rollout 会不会来回摆
验证 · 度量⑧ 评测开环、伪仿真、闭环分别能看出什么;数字能不能横比

图例:各论文表中,行首带彩色竖线的是该线的重点必读论文,也就是“阅读顺序”里建议优先读的节点。竖线颜色对应所属的线:琥珀 = 生成,绿 = 打分,紫 = RL,棕 = 扩展线。

⓪ 场景编码 稀疏 / BEV / 冻结 ViT ① 生成器 query / 词表 / 扩散 / flow ② 打分器 多目标子指标 / 世界模型 输出轨迹 K 条候选 argmax ③ RL:分数 / 规则 / 世界模型 → 奖励 → 更新生成器 测试时优化(TOAD):用打分器在候选附近搜索
图 1 三条主线构成一个闭环:生成器提出候选,打分器选择;虚线是两种反馈,上方为测试时优化,下方为 RL 更新生成器。
Line 0 · 扩展线

感知感知与场景表示线:规划头能看到什么

规划头只能利用输入里存在、并且以可用形式存在的信息。这条线的核心问题是表示单元:按“位置”切网格(稠密 BEV),还是按“物体”分配 query(稀疏)。二段式可以看作这条线的极端情况:感知冻结,接口被人为量化成结构化结果。

核心机制

稠密 BEV:以位置为单元

\[F_{\text{BEV}}\in\mathbb{R}^{H\times W\times C},\quad\text{如 }200\times200\times256\ \ (\pm50\,\text{m},\ 0.5\,\text{m/格})\]

相机转 BEV 有两条路。LSS 对每个像素预测深度分布,把特征沿射线抬升,再拍扁到网格:

\[f(u,v,d)=\alpha_d(u,v)\,c(u,v),\qquad \textstyle\sum_d\alpha_d(u,v)=1\]

BEVFormer 反过来,让每个格子当 query、投影回图像取特征。多传感器、多帧都容易对齐;代价是计算量随感知面积增长,大部分格子是空路面。

稀疏 query:以物体为单元

\[q_i=(b_i,f_i),\quad f_i\leftarrow f_i+\sum_{c,m}w_{c,m}\,F^{c}\big(\Pi_c(k_m(b_i))\big),\quad b_i\leftarrow b_i+\Delta b(f_i)\]

anchor \(b_i\) 是 3D 框,\(k_m\) 是框上的关键点,\(\Pi_c\) 投影到第 \(c\) 个相机(示意)。几百个 query 逐层取特征、修正 anchor,并在帧间传递,检测与跟踪统一。计算量随物体数量增长;形状不规则的障碍物要靠 OCC 补。

DETR:query 的源头

\[\hat\sigma=\arg\min_{\sigma}\sum_{i}\mathcal{L}_{\text{match}}\big(y_i,\ \hat y_{\sigma(i)}\big)\]

匈牙利匹配把 N 个 query 与真值一一对应,表示单元从“每个位置”变成“每个物体”。规划里的 trajectory query 是同一个概念,只是负责的对象换成了“意图”。

冻结与接口:一段式到二段式的光谱

完全端到端→部分冻结 / LoRA→冻结编码器→二段式

“冻结”决定能不能为规划优化特征;“量化”(置信度阈值、NMS、人为定义的字段)决定多少信息能传过来,后者往往才是二段式的上限所在。二段式换来的是可诊断、可在结构化状态上仿真、可直接复用规则。

软接口:结构化结果之外,再传置信度、低于阈值的候选或 query 特征。UniAD、SparseDrive 模块之间传的就是 query。

代表论文

论文机构发表表示核心贡献链接
PointPillarsnuTonomyCVPR 2019LiDAR 柱状 BEV点云落到柱状网格,变成 BEV 伪图像1812.05784
Lift-Splat-ShootNVIDIA / 多伦多大学ECCV 2020相机 BEV(前向)深度分布抬升 + 拍扁到网格2008.05711
BEVFormer上海 AI Lab 等ECCV 2022相机 BEV(反向)BEV query 投影回图像取特征 + 时序 BEV2203.17270
BEVFusionMITICRA 2023多传感器 BEV相机与 LiDAR 在同一张 BEV 上融合2205.13542
DETRMetaECCV 2020query匈牙利匹配,以物体为表示单元2005.12872
UniAD上海 AI Lab 等CVPR 2023BEV + 任务 query规划导向:query 串起检测、跟踪、建图、预测、占用、规划2212.10156
VAD华科 / 地平线ICCV 2023向量化矢量地图与轨迹替代栅格,大幅提速2303.12077
Sparse4D v3地平线arXiv 2023稀疏 4D query承接 v1/v2 的 anchor 关键点采样,统一检测与跟踪2311.11722
SparseDrive清华 / 地平线ICRA 2025全稀疏对称稀疏感知 + 并行运动规划 + 碰撞感知重打分2405.19620
SSR中科院自动化所等ICLR 2025少量隐 token导航引导的稀疏 token + 隐世界模型监督,不依赖感知标注2409.18341

Line 1 · 主线

生成轨迹生成线:规划头怎么输出轨迹

轨迹头有三个彼此独立的设计维度:输出参数化、多模态机制、推理步数。很多论文的贡献只动其中一个,读的时候先定位它动的是哪一维。

维度 A · 输出参数化

表示形式代表特点
绝对航点\(\tau=\{p_t\}_{t=1}^{T}\)UniAD, VAD直接;远端误差大,loss 被远端主导
增量 + cumsum\(p_t=\sum_{s\le t}\Delta_s\)多数 query 规划器平滑;误差沿时间累积,早期点梯度被放大 \(T-t+1\) 倍
相对参考的残差\(\tau=\tau^{\text{ref}}+\Delta\)ResAD参考 = 惯性外推,模型只学“为什么偏离”
低维基 / token\(\tau=\mu+Uc,\;c\in\mathbb{R}^{d}\)PCA 系数、离散 token天然平滑,探索空间小,便于 GRPO
贝塞尔控制点\(\tau=BP,\ B_{ij}=\tbinom{n}{j}s_i^{\,j}(1-s_i)^{n-j}\)—解析低维基,与 PCA 同族;天然平滑、端点可硬约束、导数仍是贝塞尔;控制点空间做 RL 探索轨迹依然平滑
控制量曲率 \(\kappa_t\) + 加速度 \(a_t\)CarPlanner 等运动学可行有保证;开环指标上吃亏

维度 B · 多模态机制

多 query + Winner-Takes-All

\[\mathcal{L}=\min_k \ell\big(\hat\tau_k,\tau^{gt}\big)\;+\;\mathrm{CE}\big(\pi,\;k^{*}\big),\quad k^{*}=\arg\min_k\lVert\hat\tau_k-\tau^{gt}\rVert\]

MTR 系。只有 \(k^{*}\) 拿到回归梯度,其余 query 几乎无监督。这就是后面“负模态缺监督”问题的根源。

锚定截断扩散(DiffusionDrive)

\[\tau^{k}_{t}=\sqrt{\bar\alpha_t}\,a_k+\sqrt{1-\bar\alpha_t}\,\epsilon,\quad t\le T_{\text{trunc}}\ll T\]

从 anchor 加少量噪声出发而不是纯高斯,等价于一个以 anchor 为中心的 GMM 先验;去噪只需约 2 步。

残差 + 逐点归一化(ResAD)

\[\hat\tau=\tau^{\text{inert}}+\sigma_t\odot\tilde\Delta,\qquad \tilde\Delta_t=\frac{\Delta_t}{\sigma_t}\in[-\gamma,\gamma]\]

PRNorm 把每个时间步的残差缩放到对称区间,远端大残差不再主导梯度。IRP 再对惯性参考做扰动来产生多样意图。(\(\sigma_t\) 为示意记号)

目标条件 / 单步生成

GoalFlow:先对候选目标点打分选 goal,再以 goal 为条件做 flow matching,从而避免模态平均。CLEAR:冻结编码器 + 单步 drift 解码器 + 交叉注意力打分器,去掉迭代采样。

维度 C · 推理步数

DDPM ~1000→DDIM ~20→截断扩散 2→残差扩散 2→单步 1

对车端(Orin / Thor)而言,扩散头只有在 ≤2 步时才真正有吸引力。

代表论文

论文机构发表动的维度核心贡献链接
MTRMPI / CUHKNeurIPS 2022B意图 query + 局部精修,WTA 范式源头(运动预测)2209.13508
VADv2华科 / 地平线arXiv 2024B大轨迹词表上的概率分布,离散化多模态2402.13243
DiffusionDrive华科 / 地平线CVPR 2025B · C锚定截断扩散 + 级联解码器 88.1 PDMS2411.15139
GoalFlow地平线等CVPR 2025Bgoal 打分 + goal 条件 flow matching2503.05689
ResAD华科 / 地平线 / 武大CVPR 2026A · B惯性参考残差 + PRNorm + IRP;两步去噪 88.8 PDMS · 85.5 EPDMS2510.08562
CLEAR—arXiv 2026.06C单步 drift 解码器 + 交叉注意力打分 93.7 PDMS2606.06219

NAVSIM v1 PDMS 与 v2 EPDMS 不可横比;SparseDriveV2 还指出 v2 有修正版 EPDMS,引用数字时注意协议。


Line 2 · 主线

打分打分 / 选择线:生成候选 + 学习评估

分水岭在于打分器的监督信号从哪来。只拿“离 GT 多近”监督,打分器学到的是“像不像人”;拿规则子指标监督,学到的是“规则会怎么评价”。

核心机制

Hydra-MDP:多目标蒸馏(本线的基本范式)

对每个场景、词表中每条候选 \(\tau_i\),离线用 PDM 规则算出子指标标签 \(y_{m,i}\in[0,1]\)(NC、DAC、TTC、EP、Comfort…)。训练:

\[\mathcal{L}=\underbrace{-\sum_i y^{\text{im}}_i\log\mathrm{softmax}(s^{\text{im}})_i}_{\text{模仿头:}\;y^{\text{im}}\propto \exp(-\lVert\tau_i-\tau^{gt}\rVert^2)}\;+\;\sum_{m}\sum_i \mathrm{BCE}\big(\sigma(s_{m,i}),\,y_{m,i}\big)\]

推理:各头对数加权聚合后取 argmax。

\[\tau^{*}=\arg\max_i\;\Big(w_{\text{im}}\log p^{\text{im}}_i+\sum_m w_m\log \sigma(s_{m,i})\Big)\]

要点:子指标分头监督,不要先合成一个标量再回归;模仿头保留“人类风格”,规则头负责“安全可行”。

候选从哪来

  • 静态词表:覆盖广、粒度粗(Hydra-MDP、ZTRS)
  • 动态提议:粒度细、覆盖窄(扩散 / query 输出)
  • 混合:GTRS 用超密词表 + dropout 训练,推理时同时评估词表和扩散提议
  • 因子化:SparseDriveV2 把轨迹拆成几何路径 × 速度曲线,先粗打分再细打分,词表密度提升 32×

测试时优化(TOAD)

“先生成再打分”的上限受限于候选集质量。TOAD 把打分器 \(S_\phi\) 当奖励,用交叉熵方法在提议附近搜索:

\[\mu,\Sigma\leftarrow\mathrm{fit}\big(\mathrm{top}\text{-}e\{\tau^{(j)}\sim\mathcal N(\mu,\Sigma)\}\ \text{按}\ S_\phi\big)\]

免重训、即插即用;六个基础规划器上一致提升。

代表论文

论文机构发表候选 / 监督核心贡献链接
Hydra-MDPNVIDIAarXiv 2024词表 / 规则蒸馏多目标 Hydra 蒸馏,PDM 子指标分头监督 NAVSIM 2024 挑战赛第一2406.06978
Hydra-MDP++NVIDIAarXiv 2025词表 / 扩展指标专家引导的蒸馏,指标更全2503.12820
Hydra-NeXtNVIDIAarXiv 2025词表开环训练下的闭环鲁棒性2503.12030
WoTE中科院自动化所ICCV 2025BEV 世界模型推演把候选推演到未来再打分2504.01941
iPad—arXiv 2025迭代提议以候选为中心的迭代精修2505.15111
DriveSuprimNVIDIA 等arXiv 2025由粗到细区分相近候选的精确选择2506.06659
GTRSNVIDIAarXiv 2025词表 + 扩散混合词表 dropout 泛化、传感器增广、细粒度精修 NAVSIM v2 挑战赛冠军2506.06664
R2SE—arXiv 2025打分 + RL 精修强化精修 + 自感知扩展2506.09800
SparseDriveV2清华 / 地平线ECCV 2026因子化超密词表路径 × 速度因子化;证明词表越密越好且未饱和 92.0 PDMS · 90.1 EPDMS2603.29163
TOAD—arXiv 2026.06测试时 CEM打分器即奖励,测试时搜索 94.7 PDMS2606.07170

Line 3 · 主线

RLRL / 后训练线:摆脱纯模仿

模仿学习只有正样本:学不到“这样会撞”,容易走捷径(自车历史),闭环误差累积。RL 这条线可以拆成两个正交维度:奖励从哪来、用什么算法。另外要分清“单步开环 RL”(对一次规划打分,不 rollout)和“真闭环 RL”(需要仿真 / 重建 / 世界模型环境)。

核心机制

GRPO:组内相对 advantage

\[A_i=\frac{r_i-\mathrm{mean}(\{r_j\}_{j\in G})}{\mathrm{std}(\{r_j\}_{j\in G})}\]
\[\mathcal L=-\mathbb E_i\Big[\min\big(\rho_iA_i,\ \mathrm{clip}(\rho_i,1\!\pm\!\epsilon)A_i\big)\Big]+\beta\,\mathrm{KL}\big(\pi_\theta\Vert\pi_{\text{ref}}\big)\]

不需要 critic,天然适合“一个场景采样多条轨迹”。关键在于组 \(G\) 怎么划分。

DiffusionDriveV2 对 GRPO 的三处改造

  • 乘性、尺度自适应探索噪声:远端点大扰动、近端点小扰动,探索出的轨迹仍平滑(加性高斯会抖)
  • anchor 内 GRPO:\(G\) = 同一 anchor 生成的样本,只在同一意图内比较
  • anchor 间截断 GRPO:引入跨 anchor 的全局视角,但截断不合理的跨意图比较(左转 vs 直行)

对扩散策略,\(\rho_i\) 由去噪链上各步高斯转移的对数概率累加得到。

EPO:枚举式策略优化(ZTRS)

\[\nabla_\theta J=\sum_{i=1}^{n}\nabla_\theta\,\pi_\theta(a_i\mid s)\,\big(r(a_i,s)-b(s)\big)\]

动作空间是可枚举的词表,就不用采样,直接对全部候选算期望梯度(\(b\) 为基线,示意)。解决了纯 RL 冷启动,完全不用人类示范。

奖励设计:CaRL 的极简主义

\[r=\mathrm{RC}\cdot\prod_{j}\lambda_j^{\,\mathbb 1[\text{违规}_j]},\quad \lambda_j\in(0,1)\ \text{或直接终止}\]

复杂的加和式 shaped reward 在大 mini-batch 下 PPO 优化不动;改成以路线完成度为主、违规乘性惩罚后,PPO 可扩展到数亿样本。

奖励来源谱系

奖励来源代表优点主要风险
规则指标(PDMS / EPDMS)DiffusionDriveV2, ReCogDrive, ZTRS可靠、便宜被 hack:过度保守、EP 下降
学习型打分器RAD-2 判别器, R2SE稠密、可微、可泛化打分器本身的盲区会被策略利用
世界模型评论家AD-R1能推演后果乐观偏差:只见过安全数据,会“幻想”安全未来
重建仿真(3DGS)RAD, RAD-2, World Engine真闭环、逼真重建成本、新视角伪影
传统仿真(特权输入)CaRL样本量可到数亿sim-to-real 差距

代表论文

论文机构发表奖励 / 算法核心贡献链接
RAD华科 / 地平线NeurIPS 20253DGS 环境 / PPO + IL 正则真实场景数字孪生里做大规模试错 碰撞率降至 IL 的 1/32502.13144
AlphaDrive华科 / 地平线arXiv 2025规则 / GRPO首次把 GRPO 引入驾驶规划(VLM)2503.07608
CaRLTübingenCoRL 2025仿真 / PPO简单奖励让 PPO 可扩展 nuPlan Val14 91.32504.17838
ReCogDrive华科 / 小米等ICLR 2026规则 / diff-GRPOVLM + 扩散规划头,扩散版 GRPO2506.08052
DriveDPO中科院自动化所arXiv 2025偏好 / 安全 DPO用安全偏好对做 DPO2509.17940
ZTRSNVIDIA 等arXiv 2025规则 / EPO零人类示范,纯奖励训练词表打分器 Navhard SOTA2510.24108
AD-R1—CVPR 2026 Findings世界模型 / 闭环 RL反事实合成负样本,训练“诚实”的世界模型2511.20325
DiffusionDriveV2华科 / 地平线arXiv 2025.12规则 / 分组 GRPOanchor 内 / 间 GRPO + 乘性探索噪声2512.07745
RAD-2华科 / 地平线arXiv 2026.04判别器 / TC-GRPO扩散生成器 + RL 优化的判别器重排序;BEV-Warp 高吞吐仿真2604.15308
World EngineOpenDriveLab2026重建 + 安全关键场景合成量产规模后训练(8 万小时基座) 碰撞率 −45.5%项目页

RAD-2:三条线交汇的样板

RAD-2 同时用到了三条线:扩散生成器出候选(线 1),Transformer 判别器负责重排序(线 2),判别器用时间一致的 GRPO 从闭环反馈中学习,生成器再用低奖励 rollout 转化来的纵向优化信号做 on-policy 更新(线 3)。它的核心论点是:不把稀疏标量奖励直接压到高维轨迹空间上,而是先训判别器,优化更稳定。

常见坑

  • 跨意图 advantage 比较:左转样本和直行样本放同一组,梯度互相打架
  • 加性高斯探索噪声:轨迹抖动,打分器被“噪声轨迹”误导
  • 没有 IL / KL 锚:策略漂离人类分布,最终 hack 奖励(RAD 用 IL 正则就是为此)
  • 奖励只看安全:退化成“停着不动”,需要进度项平衡
  • 世界模型乐观偏差:只用专家数据训练的世界模型当评论家,会对危险轨迹给出过高评价

Line 4 · 扩展线

蒸馏模仿与蒸馏线:从行为克隆到 on-policy 蒸馏

纯模仿只见过人类“开得好”的状态。上路后一旦出现小偏差,就进入训练中没见过的状态,偏差越积越大。这条线要解决的是状态分布问题:让学生在自己犯错后的状态上得到纠正。它和打分线、RL 线的区别在于监督信号:蒸馏里教师直接给“答案”,打分里教师给“评分标准”,RL 里只有标量奖励。

核心机制

误差累积:行为克隆 vs DAgger

\[J(\pi_{\text{BC}})\le J(\pi^{*})+O(T^{2}\epsilon),\qquad J(\pi_{\text{DAgger}})\le J(\pi^{*})+O(T\epsilon)\]

\(T\) 为时域长度,\(\epsilon\) 为单步模仿误差,\(J\) 为累计代价(Ross 等人的经典结论,示意)。行为克隆一步错就会把学生带到没见过的状态,误差随时域平方增长。

on-policy 蒸馏 vs on-policy RL

\[\min_\theta\ \mathbb{E}_{s\sim d^{\pi_\theta}}\big[\ell(\pi_\theta(s),\pi_{\text{T}}(s))\big]\quad\text{vs}\quad\max_\theta\ \mathbb{E}_{\tau\sim\pi_\theta}\big[\textstyle\sum_t\gamma^t r_t\big]\]

外层期望都在学生自己的状态分布 \(d^{\pi_\theta}\) 上;里面一个是教师动作(稠密),一个是标量奖励(稀疏)。蒸馏样本效率高、上限约等于教师;RL 需要探索,但有机会超过教师。

训练信号的两个维度:状态从哪来 × 监督是什么

教师给动作(稠密)教师给候选评分只给标量奖励(稀疏)
日志状态(off-policy)行为克隆、离线蒸馏(Alpamayo 云端教师生成标签)Hydra-MDP、GTRS、SparseDriveV2(线 2)开环 GRPO(DiffusionDriveV2)、ZTRS 的 EPO(线 3)
学生 rollout 的状态(on-policy)DAgger、LBC、Roach(本线)RAD-2 判别器(用闭环反馈训练)CaRL、RAD(闭环 PPO)

开环 GRPO 的动作是当前模型采样的,状态却来自人类日志,所以它能教“同一状态下选更好的动作”,解决不了误差累积。

on-policy 数据从哪来:仿真的四档保真度

档位做法真 on-policy?适用
0 · 只扰动ChauffeurNet 式:偏移日志中的自车位姿,教师给出“拉回”轨迹否,近似零仿真起步,同时缓解自车状态捷径
1 · 仅自车闭环日志回放:他车按日志走,自车按学生输出推演,重建结构化 token对自车是planner-only 基本够用;rollout 要短(2–4 s),注意后车追尾造成的假碰撞
2 · 他车可反应他车由 IDM 等规则驱动(nuPlan reactive 模式)是交互密集的场景
3 · 传感器仿真3DGS 重建或世界模型渲染新视角;BEV-Warp 是特征级折中是一段式模型

代表论文

论文机构发表形式核心贡献链接
DAggerCMUAISTATS 2011on-policy 数据聚合学生开、教师在学生到达的状态上标注;误差从 \(T^2\) 降到 \(T\)1011.0686
ChauffeurNetWaymoRSS 2019扰动合成偏移自车位姿并监督“拉回来”,不用仿真就近似出 on-policy 数据1812.03079
LBCUT Austin / IntelCoRL 2019特权教师 → 学生先在真值感知上训练特权教师,再蒸馏给传感器学生1912.12294
RoachETHICCV 2021RL 教师教师用 RL 在特权输入上训练,学生做 on-policy 蒸馏2108.08265
PlanTTübingenCoRL 2022目标级输入规划器以目标级 token 为输入的规划 Transformer,是结构化输入规划器的代表2210.14222
Hydra-MDPNVIDIAarXiv 2024蒸馏评价函数蒸馏规则的打分而不是动作(详见线 2)2406.06978

Line 5 · 扩展线

世界模型世界模型线:更稠密的监督与想象中的环境

一条轨迹只有几十个数,却要监督上亿参数,DriveVLA-W0 把这叫“监督赤字”。世界模型有两种用法:训练时当稠密的自监督信号,或者当 RL 的环境和评论家。

核心机制

隐空间自监督(LAW 类)

\[\mathcal{L}=\mathcal{L}_{\text{plan}}+\lambda\,\big\lVert\hat z_{t+1}(z_t,a_t)-\mathrm{sg}(z_{t+1})\big\rVert^{2}\]

用当前隐特征和动作预测下一帧隐特征,\(\mathrm{sg}\) 为 stop-gradient(示意)。不需要感知标注,就能逼编码器学到场景动态。SimWAM 更进一步:视频分支只在训练时用,训练完丢掉,推理延迟不增加。

世界模型当评论家:乐观偏差

只用专家数据训练的世界模型从没见过事故。给它一条危险轨迹,它会“想象”出安全的未来:障碍物消失、道路被无视。

AD-R1 的做法是程序化合成碰撞、出界等负样本,让世界模型学会诚实地预测危险,再作为 RL 的内部评论家。

代表论文

论文机构发表用法核心贡献链接
GAIA-1WayvearXiv 2023生成式早期的大规模驾驶视频世界模型2309.17080
Vista港大 / OpenDriveLab 等NeurIPS 2024生成式高保真、可控的驾驶世界模型2405.17398
Think2Drive上交ECCV 2024环境在隐世界模型的想象中训练 RL 策略(CARLA)2402.16720
LAW中科院自动化所ICLR 2025训练信号预测未来隐特征作为自监督,减少对感知标注的依赖2406.08481
WoTE中科院自动化所ICCV 2025评估器把候选推演到未来再打分(详见线 2)2504.01941
DriveVLA-W0中科院自动化所等ICLR 2026训练信号提出“监督赤字”;未来图像预测让性能随数据量持续提升2510.12796
SimWAM—arXiv 2026.08训练信号视频分支只作训练信号,训练后丢弃,留下低延迟规划器 91.5 PDMS2608.07468
AD-R1—CVPR 2026 Findings评论家反事实合成负样本,训练“诚实”的世界模型(详见线 3)2511.20325

Line 6 · 扩展线

VLAVLA 线:大模型进入驾驶决策

语言模型负责高层理解和推理,动作专家负责出轨迹。工业侧越来越把大模型放在云端当教师,而不是直接上车。

双系统(慢思考 + 快系统)→统一成语言生成→VLM 对齐生成式规划头→GRPO + 推理→自适应 / 隐式推理→云端教师与蒸馏

要点

为什么上车难

  • 10B 量级模型的推理延迟很难满足实时规划。
  • 文本推理链对长尾语义理解有帮助,对轨迹的几何精度帮助有限。
  • 所以 Alpamayo 1.5 的官方定位之一,是生成推理轨迹和轨迹标签,蒸馏出能部署到 DRIVE 车端平台的小模型。

代表论文

论文机构发表阶段核心贡献链接
DriveVLM理想 / 清华CoRL 2024双系统VLM 慢思考 + 端到端快系统2402.12289
Senna华科 / 地平线IJCV 2026双系统VLM 输出高层决策,端到端模型负责轨迹2410.22313
EMMAWaymoTMLR 2025语言生成检测、建图、规划全部表示成文本,由多模态大模型统一生成2410.23262
ORION小米 / 华科ICCV 2025对齐规划头VLM 推理空间与生成式规划头的动作空间端到端对齐2503.19755
AlphaDrive华科 / 地平线arXiv 2025GRPO + 推理第一个把 GRPO 用到驾驶规划上的 VLM 工作2503.07608
AutoVLAUCLANeurIPS 2025自适应推理按场景决定是否推理,并用强化微调优化2506.13757
LaST-VLA—arXiv 2026隐式推理把推理从文本 CoT 挪到隐式时空空间2603.01928
Alpamayo 1.5NVIDIA2026云端教师8.2B 推理骨干 + 2.3B 动作专家,RL 后训练;支持导航引导与可变相机数HF

Line 7 · 扩展线

诊断捷径与时序一致性线:模型学到的是不是假规律

两个开环指标看不出来、上路才暴露的问题。捷径:自车状态干净好用,“保持当前运动”几乎总是对的,模型会绕过场景直接外推。时序一致性:每帧预测都很平滑,串起来执行的 rollout 却会来回摆。

核心机制

捷径诊断

\[\Delta_{\text{ego}}=M\big(\pi;\,o\big)-M\big(\pi;\,o\setminus\text{ego}\big)\]

推理时把自车历史置零或加扰动,看指标 \(M\) 掉多少,并按场景拆开:惯性场景(匀速跟车)和需要偏离惯性的场景(起步、前车切入、路口转弯)。几乎不掉说明模型没在用它;只在惯性场景上掉得多,说明在走捷径(示意)。

为什么一段式更严重

从像素里学场景更难,监督又只有一条低维轨迹,难易差距更大。即使删掉 ego 输入,多帧 BEV 对齐和 LiDAR 运动补偿也会隐式泄漏自车运动。

常用对策:辅助感知监督、世界模型自监督、ego dropout / 晚注入、评测去偏(NAVSIM 的设计初衷之一)。

rollout 与单帧规划的区别

\[\mathcal{C}_t=\frac{1}{K}\sum_{k=1}^{K}\big\lVert\tau_t(t{+}k\Delta)-\tau_{t-1}(t{+}k\Delta)\big\rVert\]

相邻两帧预测在重叠时段上的差异,可以当作帧间一致性指标(示意)。开环 L2 和 PDMS 都不惩罚它。rollout 一词来自西洋双陆棋“掷骰子把棋下完”,指策略逐步执行得到的结果,区别于单帧的 planned trajectory。

从表示侧能做的事

  • ego dropout 或加噪,逼模型去看场景
  • 截短历史,减少可外推的信息
  • 晚注入:先让规划 query 与场景交互,后面的层再加入自车状态
  • 残差参数化:把惯性外推交给参考轨迹(ResAD,线 1)

代表论文

论文机构发表问题核心贡献链接
Causal ConfusionBerkeley 等NeurIPS 2019捷径信息越多模仿反而越差的反直觉现象,捷径问题的理论出发点1905.11979
Limitations of BCCVC / TRIICCV 2019捷径系统分析行为克隆的分布偏移、惯性问题和训练方差1904.08980
AD-MLP百度arXiv 2023捷径只用自车状态的 MLP,在 nuScenes 开环指标上接近当时 SOTA2305.10430
Is Ego Status All You NeedNVIDIA / 南大CVPR 2024捷径UniAD、VAD 等一段式模型的规划表现主要来自自车状态;诊断方法可直接借用2312.03031
Hidden BiasesTübingenarXiv 2024捷径从数据集角度分析端到端驾驶中的隐藏偏差2412.09602
CausalVAD—arXiv 2026捷径用因果干预去混淆2603.18561
MomAD—CVPR 2025时序一致性在 SparseDrive 上引入轨迹动量与感知动量,缓解前后帧规划跳变2503.03125

时序一致性目前专门的工作不多;RAD-2 的时间一致 GRPO(线 3)也在解决同一问题。


Line 8 · 扩展线

评测评测线:数字能不能比,改动有没有用

开环 L2 会奖励外推,看不出行为问题;伪仿真把轨迹放进非反应式仿真打规则分;闭环评测才能看到误差累积和时序问题。评测协议决定了其他各条线的数字能否互相比较。

nuScenes 开环 L2→nuPlan 闭环→NAVSIM v1(PDMS)→NAVSIM v2(EPDMS)/ Navhard→Bench2Drive / HUGSIM 闭环→工业闭环平台

核心机制

PDMS(NAVSIM v1)

\[\mathrm{PDMS}=\mathrm{NC}\times\mathrm{DAC}\times\frac{5\,\mathrm{EP}+5\,\mathrm{TTC}+2\,\mathrm{C}}{12}\]

碰撞(NC)和可行驶区域(DAC)是乘性惩罚,一票否决;进度(EP)、碰撞时间(TTC)、舒适度(C)加权平均。v2 的 EPDMS 增加了交通规则、车道保持、扩展舒适度等项,并且有修正版。

读数字时的注意点

  • v1 PDMS、v2 EPDMS、闭环驾驶分之间不能横比
  • v1 已经卷到 93–95,区分度在下降
  • 开环(包括 NAVSIM)没有状态漂移,on-policy 蒸馏和时序一致性的收益在上面看不出来
  • 看清是否用了特权输入、backbone 大小、是否做了模型集成

代表论文

论文机构发表类型核心贡献链接
CARLAIntel / CVCCoRL 2017仿真闭环学术界最常用的开源驾驶仿真器1711.03938
nuScenesMotionalCVPR 2020开环早期端到端开环评测的主要数据集;它的局限催生了后面的基准1903.11027
nuPlanMotionalarXiv 2021闭环面向学习型规划的闭环基准,支持他车反应式回放2106.11810
PDMTübingenCoRL 2023指标来源规则规划器 PDM-Closed 胜过学习方法;PDM score 出自这里(详见线 2)2306.07962
NAVSIMTübingen / NVIDIA 等NeurIPS 2024伪仿真非反应式伪仿真 + PDMS;目前生成与打分线的主战场2406.15349
Bench2Drive上交NeurIPS 2024闭环CARLA 上按能力拆分的闭环端到端基准2406.03877
HUGSIM浙大等arXiv 2024重建闭环基于 3DGS 的实时照片级闭环仿真器2412.01718

Reading order

阅读顺序

每条线一篇必读

选择原则:先读这一篇,就能理解这条线的核心思路,后面的论文基本都是在它上面改的。

线必读为什么选它链接
⓪ 感知与表示SparseDrive一篇讲清楚稀疏 query 感知怎么接到规划;DiffusionDrive(nuScenes 版)、MomAD、SparseDriveV2 都是在它上面做的2405.19620
① 轨迹生成DiffusionDriveanchor 加截断扩散,是生成线的枢纽;ResAD、DiffusionDriveV2 都直接建在它上面2411.15139
② 打分 / 选择Hydra-MDP确立了“规则子指标分头监督”这个范式;GTRS、SparseDriveV2 都是在它上面扩展2406.06978
③ RL 后训练DiffusionDriveV2直接对规划头做 GRPO,把分组方式、探索噪声这些关键坑讲得很具体,而且能接着 DiffusionDrive 读2512.07745
④ 模仿与蒸馏ChauffeurNet用扰动合成近似 on-policy 数据,不需要仿真;把误差累积问题和实用解法放在了一起1812.03079
⑤ 世界模型DriveVLA-W0提出“监督赤字”,并用实验说明世界模型监督能放大数据 scaling,最能讲清楚为什么需要世界模型2510.12796
⑥ VLAORIONVLM 推理和生成式规划头端到端对齐,是目前 VLA 与传统规划头结合得最清楚的一篇2503.19755
⑦ 捷径与时序Is Ego Status All You Need证明主流一段式模型的规划表现主要来自自车状态,诊断方法可以直接拿来用2312.03031
⑧ 评测NAVSIM目前生成线和打分线的主战场,不先读它,就看不懂其他论文里的 PDMS 数字2406.15349

建议顺序:先读 NAVSIM 和 Is Ego Status,建立“指标意味着什么、模型可能在骗你”的判断标准;再按 SparseDrive → DiffusionDrive → Hydra-MDP → DiffusionDriveV2 读主干;最后读 ChauffeurNet、DriveVLA-W0、ORION。可替换:想看三线怎么拼成一个系统,③ 换成 RAD-2;想先看更简单的版本,⑤ 先读 LAW。

各线完整路径

⓪ 感知与表示

LSS→BEVFormer→DETR→Sparse4D v3→SparseDrive→SSR

① 生成

MTR→VADv2→DiffusionDrive→GoalFlow→ResAD→CLEAR

② 打分

Hydra-MDP→GTRS→SparseDriveV2→TOAD

③ RL

CaRL→RAD→DiffusionDriveV2→ZTRS→RAD-2→AD-R1

④ 模仿与蒸馏

DAgger→ChauffeurNet→LBC→Roach→PlanT

⑤ 世界模型

LAW→WoTE→DriveVLA-W0→SimWAM

⑥ VLA

DriveVLM→ORION→AlphaDrive→AutoVLA→Alpamayo 1.5

⑦ 捷径与时序

Causal Confusion→AD-MLP→Is Ego Status→MomAD

⑧ 评测

PDM→NAVSIM→Bench2Drive→HUGSIM

如果只读三篇:ResAD(生成头怎么改最省事)、SparseDriveV2(打分线的当前上限与因子化词表)、RAD-2(三条线怎么拼成一个系统)。扩展线各挑一篇:SparseDrive(感知)、ChauffeurNet(蒸馏)、DriveVLA-W0(世界模型)、ORION(VLA)、Is Ego Status(诊断)、NAVSIM(评测)。