端到端规划技术谱系
规划的三条主线是同一个闭环里的三个环节:生成器提出候选轨迹,打分器评估候选(用于选择,也可作奖励),RL 后训练再用奖励把生成器推向高质量区域。主线之外补了六条扩展线:输入侧的感知与场景表示,训练侧的模仿与蒸馏、世界模型,模型形态上的 VLA,以及验证侧的捷径与时序一致性、评测。每条线都按“核心问题 → 关键公式 → 代表论文”组织。
线路总览
端到端模型本质是一个策略 \(\tau^{*}=\pi_\theta(\cdot\mid o)\)。九条线分别回答它的四层问题:看什么(\(o\) 的表示)、怎么决策(\(\pi\) 怎么出轨迹、怎么选)、用什么信号学(\(\theta\) 怎么训练)、学对了没有。
| 层 | 线 | 核心问题 |
|---|---|---|
| 输入 · 看什么 | ⓪ 感知与场景表示 | 表示单元是位置(稠密 BEV)还是物体(稀疏 query);二段式是感知冻结、接口量化的极端情况 |
| 决策 · 怎么出轨迹 | ① 轨迹生成 | 输出参数化、多模态机制、推理步数 |
| 决策 · 怎么选 | ② 打分 / 选择 | 打分器的监督从哪来:离 GT 的距离,还是规则子指标 |
| 训练 · 奖励信号 | ③ RL / 后训练 | 奖励从哪来、用什么算法、单步开环还是真闭环 |
| 训练 · 教师信号 | ④ 模仿与蒸馏 | 怎样让学生在自己犯错后的状态上得到纠正 |
| 训练 · 自监督 | ⑤ 世界模型 | 预测未来能否弥补轨迹监督的稀疏;能否当环境和评论家 |
| 决策 · 模型形态 | ⑥ VLA | 大模型负责理解与推理,动作专家出轨迹;上车还是当云端教师 |
| 验证 · 诊断 | ⑦ 捷径与时序一致性 | 模型是否在外推自车状态;rollout 会不会来回摆 |
| 验证 · 度量 | ⑧ 评测 | 开环、伪仿真、闭环分别能看出什么;数字能不能横比 |
图例:各论文表中,行首带彩色竖线的是该线的重点必读论文,也就是“阅读顺序”里建议优先读的节点。竖线颜色对应所属的线:琥珀 = 生成,绿 = 打分,紫 = RL,棕 = 扩展线。
感知感知与场景表示线:规划头能看到什么
规划头只能利用输入里存在、并且以可用形式存在的信息。这条线的核心问题是表示单元:按“位置”切网格(稠密 BEV),还是按“物体”分配 query(稀疏)。二段式可以看作这条线的极端情况:感知冻结,接口被人为量化成结构化结果。
核心机制
稠密 BEV:以位置为单元
相机转 BEV 有两条路。LSS 对每个像素预测深度分布,把特征沿射线抬升,再拍扁到网格:
BEVFormer 反过来,让每个格子当 query、投影回图像取特征。多传感器、多帧都容易对齐;代价是计算量随感知面积增长,大部分格子是空路面。
稀疏 query:以物体为单元
anchor \(b_i\) 是 3D 框,\(k_m\) 是框上的关键点,\(\Pi_c\) 投影到第 \(c\) 个相机(示意)。几百个 query 逐层取特征、修正 anchor,并在帧间传递,检测与跟踪统一。计算量随物体数量增长;形状不规则的障碍物要靠 OCC 补。
DETR:query 的源头
匈牙利匹配把 N 个 query 与真值一一对应,表示单元从“每个位置”变成“每个物体”。规划里的 trajectory query 是同一个概念,只是负责的对象换成了“意图”。
冻结与接口:一段式到二段式的光谱
“冻结”决定能不能为规划优化特征;“量化”(置信度阈值、NMS、人为定义的字段)决定多少信息能传过来,后者往往才是二段式的上限所在。二段式换来的是可诊断、可在结构化状态上仿真、可直接复用规则。
软接口:结构化结果之外,再传置信度、低于阈值的候选或 query 特征。UniAD、SparseDrive 模块之间传的就是 query。
代表论文
| 论文 | 机构 | 发表 | 表示 | 核心贡献 | 链接 |
|---|---|---|---|---|---|
| PointPillars | nuTonomy | CVPR 2019 | LiDAR 柱状 BEV | 点云落到柱状网格,变成 BEV 伪图像 | 1812.05784 |
| Lift-Splat-Shoot | NVIDIA / 多伦多大学 | ECCV 2020 | 相机 BEV(前向) | 深度分布抬升 + 拍扁到网格 | 2008.05711 |
| BEVFormer | 上海 AI Lab 等 | ECCV 2022 | 相机 BEV(反向) | BEV query 投影回图像取特征 + 时序 BEV | 2203.17270 |
| BEVFusion | MIT | ICRA 2023 | 多传感器 BEV | 相机与 LiDAR 在同一张 BEV 上融合 | 2205.13542 |
| DETR | Meta | ECCV 2020 | query | 匈牙利匹配,以物体为表示单元 | 2005.12872 |
| UniAD | 上海 AI Lab 等 | CVPR 2023 | BEV + 任务 query | 规划导向:query 串起检测、跟踪、建图、预测、占用、规划 | 2212.10156 |
| VAD | 华科 / 地平线 | ICCV 2023 | 向量化 | 矢量地图与轨迹替代栅格,大幅提速 | 2303.12077 |
| Sparse4D v3 | 地平线 | arXiv 2023 | 稀疏 4D query | 承接 v1/v2 的 anchor 关键点采样,统一检测与跟踪 | 2311.11722 |
| SparseDrive | 清华 / 地平线 | ICRA 2025 | 全稀疏 | 对称稀疏感知 + 并行运动规划 + 碰撞感知重打分 | 2405.19620 |
| SSR | 中科院自动化所等 | ICLR 2025 | 少量隐 token | 导航引导的稀疏 token + 隐世界模型监督,不依赖感知标注 | 2409.18341 |
生成轨迹生成线:规划头怎么输出轨迹
轨迹头有三个彼此独立的设计维度:输出参数化、多模态机制、推理步数。很多论文的贡献只动其中一个,读的时候先定位它动的是哪一维。
维度 A · 输出参数化
| 表示 | 形式 | 代表 | 特点 |
|---|---|---|---|
| 绝对航点 | \(\tau=\{p_t\}_{t=1}^{T}\) | UniAD, VAD | 直接;远端误差大,loss 被远端主导 |
| 增量 + cumsum | \(p_t=\sum_{s\le t}\Delta_s\) | 多数 query 规划器 | 平滑;误差沿时间累积,早期点梯度被放大 \(T-t+1\) 倍 |
| 相对参考的残差 | \(\tau=\tau^{\text{ref}}+\Delta\) | ResAD | 参考 = 惯性外推,模型只学“为什么偏离” |
| 低维基 / token | \(\tau=\mu+Uc,\;c\in\mathbb{R}^{d}\) | PCA 系数、离散 token | 天然平滑,探索空间小,便于 GRPO |
| 贝塞尔控制点 | \(\tau=BP,\ B_{ij}=\tbinom{n}{j}s_i^{\,j}(1-s_i)^{n-j}\) | — | 解析低维基,与 PCA 同族;天然平滑、端点可硬约束、导数仍是贝塞尔;控制点空间做 RL 探索轨迹依然平滑 |
| 控制量 | 曲率 \(\kappa_t\) + 加速度 \(a_t\) | CarPlanner 等 | 运动学可行有保证;开环指标上吃亏 |
维度 B · 多模态机制
多 query + Winner-Takes-All
MTR 系。只有 \(k^{*}\) 拿到回归梯度,其余 query 几乎无监督。这就是后面“负模态缺监督”问题的根源。
锚定截断扩散(DiffusionDrive)
从 anchor 加少量噪声出发而不是纯高斯,等价于一个以 anchor 为中心的 GMM 先验;去噪只需约 2 步。
残差 + 逐点归一化(ResAD)
PRNorm 把每个时间步的残差缩放到对称区间,远端大残差不再主导梯度。IRP 再对惯性参考做扰动来产生多样意图。(\(\sigma_t\) 为示意记号)
目标条件 / 单步生成
GoalFlow:先对候选目标点打分选 goal,再以 goal 为条件做 flow matching,从而避免模态平均。CLEAR:冻结编码器 + 单步 drift 解码器 + 交叉注意力打分器,去掉迭代采样。
维度 C · 推理步数
对车端(Orin / Thor)而言,扩散头只有在 ≤2 步时才真正有吸引力。
代表论文
| 论文 | 机构 | 发表 | 动的维度 | 核心贡献 | 链接 |
|---|---|---|---|---|---|
| MTR | MPI / CUHK | NeurIPS 2022 | B | 意图 query + 局部精修,WTA 范式源头(运动预测) | 2209.13508 |
| VADv2 | 华科 / 地平线 | arXiv 2024 | B | 大轨迹词表上的概率分布,离散化多模态 | 2402.13243 |
| DiffusionDrive | 华科 / 地平线 | CVPR 2025 | B · C | 锚定截断扩散 + 级联解码器 88.1 PDMS | 2411.15139 |
| GoalFlow | 地平线等 | CVPR 2025 | B | goal 打分 + goal 条件 flow matching | 2503.05689 |
| ResAD | 华科 / 地平线 / 武大 | CVPR 2026 | A · B | 惯性参考残差 + PRNorm + IRP;两步去噪 88.8 PDMS · 85.5 EPDMS | 2510.08562 |
| CLEAR | — | arXiv 2026.06 | C | 单步 drift 解码器 + 交叉注意力打分 93.7 PDMS | 2606.06219 |
NAVSIM v1 PDMS 与 v2 EPDMS 不可横比;SparseDriveV2 还指出 v2 有修正版 EPDMS,引用数字时注意协议。
打分打分 / 选择线:生成候选 + 学习评估
分水岭在于打分器的监督信号从哪来。只拿“离 GT 多近”监督,打分器学到的是“像不像人”;拿规则子指标监督,学到的是“规则会怎么评价”。
核心机制
Hydra-MDP:多目标蒸馏(本线的基本范式)
对每个场景、词表中每条候选 \(\tau_i\),离线用 PDM 规则算出子指标标签 \(y_{m,i}\in[0,1]\)(NC、DAC、TTC、EP、Comfort…)。训练:
推理:各头对数加权聚合后取 argmax。
要点:子指标分头监督,不要先合成一个标量再回归;模仿头保留“人类风格”,规则头负责“安全可行”。
候选从哪来
- 静态词表:覆盖广、粒度粗(Hydra-MDP、ZTRS)
- 动态提议:粒度细、覆盖窄(扩散 / query 输出)
- 混合:GTRS 用超密词表 + dropout 训练,推理时同时评估词表和扩散提议
- 因子化:SparseDriveV2 把轨迹拆成几何路径 × 速度曲线,先粗打分再细打分,词表密度提升 32×
测试时优化(TOAD)
“先生成再打分”的上限受限于候选集质量。TOAD 把打分器 \(S_\phi\) 当奖励,用交叉熵方法在提议附近搜索:
免重训、即插即用;六个基础规划器上一致提升。
代表论文
| 论文 | 机构 | 发表 | 候选 / 监督 | 核心贡献 | 链接 |
|---|---|---|---|---|---|
| Hydra-MDP | NVIDIA | arXiv 2024 | 词表 / 规则蒸馏 | 多目标 Hydra 蒸馏,PDM 子指标分头监督 NAVSIM 2024 挑战赛第一 | 2406.06978 |
| Hydra-MDP++ | NVIDIA | arXiv 2025 | 词表 / 扩展指标 | 专家引导的蒸馏,指标更全 | 2503.12820 |
| Hydra-NeXt | NVIDIA | arXiv 2025 | 词表 | 开环训练下的闭环鲁棒性 | 2503.12030 |
| WoTE | 中科院自动化所 | ICCV 2025 | BEV 世界模型推演 | 把候选推演到未来再打分 | 2504.01941 |
| iPad | — | arXiv 2025 | 迭代提议 | 以候选为中心的迭代精修 | 2505.15111 |
| DriveSuprim | NVIDIA 等 | arXiv 2025 | 由粗到细 | 区分相近候选的精确选择 | 2506.06659 |
| GTRS | NVIDIA | arXiv 2025 | 词表 + 扩散混合 | 词表 dropout 泛化、传感器增广、细粒度精修 NAVSIM v2 挑战赛冠军 | 2506.06664 |
| R2SE | — | arXiv 2025 | 打分 + RL 精修 | 强化精修 + 自感知扩展 | 2506.09800 |
| SparseDriveV2 | 清华 / 地平线 | ECCV 2026 | 因子化超密词表 | 路径 × 速度因子化;证明词表越密越好且未饱和 92.0 PDMS · 90.1 EPDMS | 2603.29163 |
| TOAD | — | arXiv 2026.06 | 测试时 CEM | 打分器即奖励,测试时搜索 94.7 PDMS | 2606.07170 |
RLRL / 后训练线:摆脱纯模仿
模仿学习只有正样本:学不到“这样会撞”,容易走捷径(自车历史),闭环误差累积。RL 这条线可以拆成两个正交维度:奖励从哪来、用什么算法。另外要分清“单步开环 RL”(对一次规划打分,不 rollout)和“真闭环 RL”(需要仿真 / 重建 / 世界模型环境)。
核心机制
GRPO:组内相对 advantage
不需要 critic,天然适合“一个场景采样多条轨迹”。关键在于组 \(G\) 怎么划分。
DiffusionDriveV2 对 GRPO 的三处改造
- 乘性、尺度自适应探索噪声:远端点大扰动、近端点小扰动,探索出的轨迹仍平滑(加性高斯会抖)
- anchor 内 GRPO:\(G\) = 同一 anchor 生成的样本,只在同一意图内比较
- anchor 间截断 GRPO:引入跨 anchor 的全局视角,但截断不合理的跨意图比较(左转 vs 直行)
对扩散策略,\(\rho_i\) 由去噪链上各步高斯转移的对数概率累加得到。
EPO:枚举式策略优化(ZTRS)
动作空间是可枚举的词表,就不用采样,直接对全部候选算期望梯度(\(b\) 为基线,示意)。解决了纯 RL 冷启动,完全不用人类示范。
奖励设计:CaRL 的极简主义
复杂的加和式 shaped reward 在大 mini-batch 下 PPO 优化不动;改成以路线完成度为主、违规乘性惩罚后,PPO 可扩展到数亿样本。
奖励来源谱系
| 奖励来源 | 代表 | 优点 | 主要风险 |
|---|---|---|---|
| 规则指标(PDMS / EPDMS) | DiffusionDriveV2, ReCogDrive, ZTRS | 可靠、便宜 | 被 hack:过度保守、EP 下降 |
| 学习型打分器 | RAD-2 判别器, R2SE | 稠密、可微、可泛化 | 打分器本身的盲区会被策略利用 |
| 世界模型评论家 | AD-R1 | 能推演后果 | 乐观偏差:只见过安全数据,会“幻想”安全未来 |
| 重建仿真(3DGS) | RAD, RAD-2, World Engine | 真闭环、逼真 | 重建成本、新视角伪影 |
| 传统仿真(特权输入) | CaRL | 样本量可到数亿 | sim-to-real 差距 |
代表论文
| 论文 | 机构 | 发表 | 奖励 / 算法 | 核心贡献 | 链接 |
|---|---|---|---|---|---|
| RAD | 华科 / 地平线 | NeurIPS 2025 | 3DGS 环境 / PPO + IL 正则 | 真实场景数字孪生里做大规模试错 碰撞率降至 IL 的 1/3 | 2502.13144 |
| AlphaDrive | 华科 / 地平线 | arXiv 2025 | 规则 / GRPO | 首次把 GRPO 引入驾驶规划(VLM) | 2503.07608 |
| CaRL | Tübingen | CoRL 2025 | 仿真 / PPO | 简单奖励让 PPO 可扩展 nuPlan Val14 91.3 | 2504.17838 |
| ReCogDrive | 华科 / 小米等 | ICLR 2026 | 规则 / diff-GRPO | VLM + 扩散规划头,扩散版 GRPO | 2506.08052 |
| DriveDPO | 中科院自动化所 | arXiv 2025 | 偏好 / 安全 DPO | 用安全偏好对做 DPO | 2509.17940 |
| ZTRS | NVIDIA 等 | arXiv 2025 | 规则 / EPO | 零人类示范,纯奖励训练词表打分器 Navhard SOTA | 2510.24108 |
| AD-R1 | — | CVPR 2026 Findings | 世界模型 / 闭环 RL | 反事实合成负样本,训练“诚实”的世界模型 | 2511.20325 |
| DiffusionDriveV2 | 华科 / 地平线 | arXiv 2025.12 | 规则 / 分组 GRPO | anchor 内 / 间 GRPO + 乘性探索噪声 | 2512.07745 |
| RAD-2 | 华科 / 地平线 | arXiv 2026.04 | 判别器 / TC-GRPO | 扩散生成器 + RL 优化的判别器重排序;BEV-Warp 高吞吐仿真 | 2604.15308 |
| World Engine | OpenDriveLab | 2026 | 重建 + 安全关键场景合成 | 量产规模后训练(8 万小时基座) 碰撞率 −45.5% | 项目页 |
RAD-2:三条线交汇的样板
RAD-2 同时用到了三条线:扩散生成器出候选(线 1),Transformer 判别器负责重排序(线 2),判别器用时间一致的 GRPO 从闭环反馈中学习,生成器再用低奖励 rollout 转化来的纵向优化信号做 on-policy 更新(线 3)。它的核心论点是:不把稀疏标量奖励直接压到高维轨迹空间上,而是先训判别器,优化更稳定。
常见坑
- 跨意图 advantage 比较:左转样本和直行样本放同一组,梯度互相打架
- 加性高斯探索噪声:轨迹抖动,打分器被“噪声轨迹”误导
- 没有 IL / KL 锚:策略漂离人类分布,最终 hack 奖励(RAD 用 IL 正则就是为此)
- 奖励只看安全:退化成“停着不动”,需要进度项平衡
- 世界模型乐观偏差:只用专家数据训练的世界模型当评论家,会对危险轨迹给出过高评价
蒸馏模仿与蒸馏线:从行为克隆到 on-policy 蒸馏
纯模仿只见过人类“开得好”的状态。上路后一旦出现小偏差,就进入训练中没见过的状态,偏差越积越大。这条线要解决的是状态分布问题:让学生在自己犯错后的状态上得到纠正。它和打分线、RL 线的区别在于监督信号:蒸馏里教师直接给“答案”,打分里教师给“评分标准”,RL 里只有标量奖励。
核心机制
误差累积:行为克隆 vs DAgger
\(T\) 为时域长度,\(\epsilon\) 为单步模仿误差,\(J\) 为累计代价(Ross 等人的经典结论,示意)。行为克隆一步错就会把学生带到没见过的状态,误差随时域平方增长。
on-policy 蒸馏 vs on-policy RL
外层期望都在学生自己的状态分布 \(d^{\pi_\theta}\) 上;里面一个是教师动作(稠密),一个是标量奖励(稀疏)。蒸馏样本效率高、上限约等于教师;RL 需要探索,但有机会超过教师。
训练信号的两个维度:状态从哪来 × 监督是什么
| 教师给动作(稠密) | 教师给候选评分 | 只给标量奖励(稀疏) | |
|---|---|---|---|
| 日志状态(off-policy) | 行为克隆、离线蒸馏(Alpamayo 云端教师生成标签) | Hydra-MDP、GTRS、SparseDriveV2(线 2) | 开环 GRPO(DiffusionDriveV2)、ZTRS 的 EPO(线 3) |
| 学生 rollout 的状态(on-policy) | DAgger、LBC、Roach(本线) | RAD-2 判别器(用闭环反馈训练) | CaRL、RAD(闭环 PPO) |
开环 GRPO 的动作是当前模型采样的,状态却来自人类日志,所以它能教“同一状态下选更好的动作”,解决不了误差累积。
on-policy 数据从哪来:仿真的四档保真度
| 档位 | 做法 | 真 on-policy? | 适用 |
|---|---|---|---|
| 0 · 只扰动 | ChauffeurNet 式:偏移日志中的自车位姿,教师给出“拉回”轨迹 | 否,近似 | 零仿真起步,同时缓解自车状态捷径 |
| 1 · 仅自车闭环 | 日志回放:他车按日志走,自车按学生输出推演,重建结构化 token | 对自车是 | planner-only 基本够用;rollout 要短(2–4 s),注意后车追尾造成的假碰撞 |
| 2 · 他车可反应 | 他车由 IDM 等规则驱动(nuPlan reactive 模式) | 是 | 交互密集的场景 |
| 3 · 传感器仿真 | 3DGS 重建或世界模型渲染新视角;BEV-Warp 是特征级折中 | 是 | 一段式模型 |
代表论文
| 论文 | 机构 | 发表 | 形式 | 核心贡献 | 链接 |
|---|---|---|---|---|---|
| DAgger | CMU | AISTATS 2011 | on-policy 数据聚合 | 学生开、教师在学生到达的状态上标注;误差从 \(T^2\) 降到 \(T\) | 1011.0686 |
| ChauffeurNet | Waymo | RSS 2019 | 扰动合成 | 偏移自车位姿并监督“拉回来”,不用仿真就近似出 on-policy 数据 | 1812.03079 |
| LBC | UT Austin / Intel | CoRL 2019 | 特权教师 → 学生 | 先在真值感知上训练特权教师,再蒸馏给传感器学生 | 1912.12294 |
| Roach | ETH | ICCV 2021 | RL 教师 | 教师用 RL 在特权输入上训练,学生做 on-policy 蒸馏 | 2108.08265 |
| PlanT | Tübingen | CoRL 2022 | 目标级输入规划器 | 以目标级 token 为输入的规划 Transformer,是结构化输入规划器的代表 | 2210.14222 |
| Hydra-MDP | NVIDIA | arXiv 2024 | 蒸馏评价函数 | 蒸馏规则的打分而不是动作(详见线 2) | 2406.06978 |
世界模型世界模型线:更稠密的监督与想象中的环境
一条轨迹只有几十个数,却要监督上亿参数,DriveVLA-W0 把这叫“监督赤字”。世界模型有两种用法:训练时当稠密的自监督信号,或者当 RL 的环境和评论家。
核心机制
隐空间自监督(LAW 类)
用当前隐特征和动作预测下一帧隐特征,\(\mathrm{sg}\) 为 stop-gradient(示意)。不需要感知标注,就能逼编码器学到场景动态。SimWAM 更进一步:视频分支只在训练时用,训练完丢掉,推理延迟不增加。
世界模型当评论家:乐观偏差
只用专家数据训练的世界模型从没见过事故。给它一条危险轨迹,它会“想象”出安全的未来:障碍物消失、道路被无视。
AD-R1 的做法是程序化合成碰撞、出界等负样本,让世界模型学会诚实地预测危险,再作为 RL 的内部评论家。
代表论文
| 论文 | 机构 | 发表 | 用法 | 核心贡献 | 链接 |
|---|---|---|---|---|---|
| GAIA-1 | Wayve | arXiv 2023 | 生成式 | 早期的大规模驾驶视频世界模型 | 2309.17080 |
| Vista | 港大 / OpenDriveLab 等 | NeurIPS 2024 | 生成式 | 高保真、可控的驾驶世界模型 | 2405.17398 |
| Think2Drive | 上交 | ECCV 2024 | 环境 | 在隐世界模型的想象中训练 RL 策略(CARLA) | 2402.16720 |
| LAW | 中科院自动化所 | ICLR 2025 | 训练信号 | 预测未来隐特征作为自监督,减少对感知标注的依赖 | 2406.08481 |
| WoTE | 中科院自动化所 | ICCV 2025 | 评估器 | 把候选推演到未来再打分(详见线 2) | 2504.01941 |
| DriveVLA-W0 | 中科院自动化所等 | ICLR 2026 | 训练信号 | 提出“监督赤字”;未来图像预测让性能随数据量持续提升 | 2510.12796 |
| SimWAM | — | arXiv 2026.08 | 训练信号 | 视频分支只作训练信号,训练后丢弃,留下低延迟规划器 91.5 PDMS | 2608.07468 |
| AD-R1 | — | CVPR 2026 Findings | 评论家 | 反事实合成负样本,训练“诚实”的世界模型(详见线 3) | 2511.20325 |
VLAVLA 线:大模型进入驾驶决策
语言模型负责高层理解和推理,动作专家负责出轨迹。工业侧越来越把大模型放在云端当教师,而不是直接上车。
要点
为什么上车难
- 10B 量级模型的推理延迟很难满足实时规划。
- 文本推理链对长尾语义理解有帮助,对轨迹的几何精度帮助有限。
- 所以 Alpamayo 1.5 的官方定位之一,是生成推理轨迹和轨迹标签,蒸馏出能部署到 DRIVE 车端平台的小模型。
代表论文
| 论文 | 机构 | 发表 | 阶段 | 核心贡献 | 链接 |
|---|---|---|---|---|---|
| DriveVLM | 理想 / 清华 | CoRL 2024 | 双系统 | VLM 慢思考 + 端到端快系统 | 2402.12289 |
| Senna | 华科 / 地平线 | IJCV 2026 | 双系统 | VLM 输出高层决策,端到端模型负责轨迹 | 2410.22313 |
| EMMA | Waymo | TMLR 2025 | 语言生成 | 检测、建图、规划全部表示成文本,由多模态大模型统一生成 | 2410.23262 |
| ORION | 小米 / 华科 | ICCV 2025 | 对齐规划头 | VLM 推理空间与生成式规划头的动作空间端到端对齐 | 2503.19755 |
| AlphaDrive | 华科 / 地平线 | arXiv 2025 | GRPO + 推理 | 第一个把 GRPO 用到驾驶规划上的 VLM 工作 | 2503.07608 |
| AutoVLA | UCLA | NeurIPS 2025 | 自适应推理 | 按场景决定是否推理,并用强化微调优化 | 2506.13757 |
| LaST-VLA | — | arXiv 2026 | 隐式推理 | 把推理从文本 CoT 挪到隐式时空空间 | 2603.01928 |
| Alpamayo 1.5 | NVIDIA | 2026 | 云端教师 | 8.2B 推理骨干 + 2.3B 动作专家,RL 后训练;支持导航引导与可变相机数 | HF |
诊断捷径与时序一致性线:模型学到的是不是假规律
两个开环指标看不出来、上路才暴露的问题。捷径:自车状态干净好用,“保持当前运动”几乎总是对的,模型会绕过场景直接外推。时序一致性:每帧预测都很平滑,串起来执行的 rollout 却会来回摆。
核心机制
捷径诊断
推理时把自车历史置零或加扰动,看指标 \(M\) 掉多少,并按场景拆开:惯性场景(匀速跟车)和需要偏离惯性的场景(起步、前车切入、路口转弯)。几乎不掉说明模型没在用它;只在惯性场景上掉得多,说明在走捷径(示意)。
为什么一段式更严重
从像素里学场景更难,监督又只有一条低维轨迹,难易差距更大。即使删掉 ego 输入,多帧 BEV 对齐和 LiDAR 运动补偿也会隐式泄漏自车运动。
常用对策:辅助感知监督、世界模型自监督、ego dropout / 晚注入、评测去偏(NAVSIM 的设计初衷之一)。
rollout 与单帧规划的区别
相邻两帧预测在重叠时段上的差异,可以当作帧间一致性指标(示意)。开环 L2 和 PDMS 都不惩罚它。rollout 一词来自西洋双陆棋“掷骰子把棋下完”,指策略逐步执行得到的结果,区别于单帧的 planned trajectory。
从表示侧能做的事
- ego dropout 或加噪,逼模型去看场景
- 截短历史,减少可外推的信息
- 晚注入:先让规划 query 与场景交互,后面的层再加入自车状态
- 残差参数化:把惯性外推交给参考轨迹(ResAD,线 1)
代表论文
| 论文 | 机构 | 发表 | 问题 | 核心贡献 | 链接 |
|---|---|---|---|---|---|
| Causal Confusion | Berkeley 等 | NeurIPS 2019 | 捷径 | 信息越多模仿反而越差的反直觉现象,捷径问题的理论出发点 | 1905.11979 |
| Limitations of BC | CVC / TRI | ICCV 2019 | 捷径 | 系统分析行为克隆的分布偏移、惯性问题和训练方差 | 1904.08980 |
| AD-MLP | 百度 | arXiv 2023 | 捷径 | 只用自车状态的 MLP,在 nuScenes 开环指标上接近当时 SOTA | 2305.10430 |
| Is Ego Status All You Need | NVIDIA / 南大 | CVPR 2024 | 捷径 | UniAD、VAD 等一段式模型的规划表现主要来自自车状态;诊断方法可直接借用 | 2312.03031 |
| Hidden Biases | Tübingen | arXiv 2024 | 捷径 | 从数据集角度分析端到端驾驶中的隐藏偏差 | 2412.09602 |
| CausalVAD | — | arXiv 2026 | 捷径 | 用因果干预去混淆 | 2603.18561 |
| MomAD | — | CVPR 2025 | 时序一致性 | 在 SparseDrive 上引入轨迹动量与感知动量,缓解前后帧规划跳变 | 2503.03125 |
时序一致性目前专门的工作不多;RAD-2 的时间一致 GRPO(线 3)也在解决同一问题。
评测评测线:数字能不能比,改动有没有用
开环 L2 会奖励外推,看不出行为问题;伪仿真把轨迹放进非反应式仿真打规则分;闭环评测才能看到误差累积和时序问题。评测协议决定了其他各条线的数字能否互相比较。
核心机制
PDMS(NAVSIM v1)
碰撞(NC)和可行驶区域(DAC)是乘性惩罚,一票否决;进度(EP)、碰撞时间(TTC)、舒适度(C)加权平均。v2 的 EPDMS 增加了交通规则、车道保持、扩展舒适度等项,并且有修正版。
读数字时的注意点
- v1 PDMS、v2 EPDMS、闭环驾驶分之间不能横比
- v1 已经卷到 93–95,区分度在下降
- 开环(包括 NAVSIM)没有状态漂移,on-policy 蒸馏和时序一致性的收益在上面看不出来
- 看清是否用了特权输入、backbone 大小、是否做了模型集成
代表论文
| 论文 | 机构 | 发表 | 类型 | 核心贡献 | 链接 |
|---|---|---|---|---|---|
| CARLA | Intel / CVC | CoRL 2017 | 仿真闭环 | 学术界最常用的开源驾驶仿真器 | 1711.03938 |
| nuScenes | Motional | CVPR 2020 | 开环 | 早期端到端开环评测的主要数据集;它的局限催生了后面的基准 | 1903.11027 |
| nuPlan | Motional | arXiv 2021 | 闭环 | 面向学习型规划的闭环基准,支持他车反应式回放 | 2106.11810 |
| PDM | Tübingen | CoRL 2023 | 指标来源 | 规则规划器 PDM-Closed 胜过学习方法;PDM score 出自这里(详见线 2) | 2306.07962 |
| NAVSIM | Tübingen / NVIDIA 等 | NeurIPS 2024 | 伪仿真 | 非反应式伪仿真 + PDMS;目前生成与打分线的主战场 | 2406.15349 |
| Bench2Drive | 上交 | NeurIPS 2024 | 闭环 | CARLA 上按能力拆分的闭环端到端基准 | 2406.03877 |
| HUGSIM | 浙大等 | arXiv 2024 | 重建闭环 | 基于 3DGS 的实时照片级闭环仿真器 | 2412.01718 |
阅读顺序
每条线一篇必读
选择原则:先读这一篇,就能理解这条线的核心思路,后面的论文基本都是在它上面改的。
| 线 | 必读 | 为什么选它 | 链接 |
|---|---|---|---|
| ⓪ 感知与表示 | SparseDrive | 一篇讲清楚稀疏 query 感知怎么接到规划;DiffusionDrive(nuScenes 版)、MomAD、SparseDriveV2 都是在它上面做的 | 2405.19620 |
| ① 轨迹生成 | DiffusionDrive | anchor 加截断扩散,是生成线的枢纽;ResAD、DiffusionDriveV2 都直接建在它上面 | 2411.15139 |
| ② 打分 / 选择 | Hydra-MDP | 确立了“规则子指标分头监督”这个范式;GTRS、SparseDriveV2 都是在它上面扩展 | 2406.06978 |
| ③ RL 后训练 | DiffusionDriveV2 | 直接对规划头做 GRPO,把分组方式、探索噪声这些关键坑讲得很具体,而且能接着 DiffusionDrive 读 | 2512.07745 |
| ④ 模仿与蒸馏 | ChauffeurNet | 用扰动合成近似 on-policy 数据,不需要仿真;把误差累积问题和实用解法放在了一起 | 1812.03079 |
| ⑤ 世界模型 | DriveVLA-W0 | 提出“监督赤字”,并用实验说明世界模型监督能放大数据 scaling,最能讲清楚为什么需要世界模型 | 2510.12796 |
| ⑥ VLA | ORION | VLM 推理和生成式规划头端到端对齐,是目前 VLA 与传统规划头结合得最清楚的一篇 | 2503.19755 |
| ⑦ 捷径与时序 | Is Ego Status All You Need | 证明主流一段式模型的规划表现主要来自自车状态,诊断方法可以直接拿来用 | 2312.03031 |
| ⑧ 评测 | NAVSIM | 目前生成线和打分线的主战场,不先读它,就看不懂其他论文里的 PDMS 数字 | 2406.15349 |
建议顺序:先读 NAVSIM 和 Is Ego Status,建立“指标意味着什么、模型可能在骗你”的判断标准;再按 SparseDrive → DiffusionDrive → Hydra-MDP → DiffusionDriveV2 读主干;最后读 ChauffeurNet、DriveVLA-W0、ORION。可替换:想看三线怎么拼成一个系统,③ 换成 RAD-2;想先看更简单的版本,⑤ 先读 LAW。
各线完整路径
⓪ 感知与表示
① 生成
② 打分
③ RL
④ 模仿与蒸馏
⑤ 世界模型
⑥ VLA
⑦ 捷径与时序
⑧ 评测
如果只读三篇:ResAD(生成头怎么改最省事)、SparseDriveV2(打分线的当前上限与因子化词表)、RAD-2(三条线怎么拼成一个系统)。扩展线各挑一篇:SparseDrive(感知)、ChauffeurNet(蒸馏)、DriveVLA-W0(世界模型)、ORION(VLA)、Is Ego Status(诊断)、NAVSIM(评测)。