中文

桥接仿真:揭示端到端自动驾驶中的 OL-CL 差距

机器人学 2026-04-14 v1 人工智能

摘要

当 OL(open-loop)预训练策略在 OL 评估中得分很高,却在闭环(closed-loop)部署中未能有效迁移时,就会出现 OL 到 CL(open-loop to closed-loop)差距(OL-CL 差距)。本文揭示了这一系统性失效的根本原因,并提出了实用的补救方案。具体而言,我们演示 OL 策略受到观察域迁移(Observational Domain Shift)和目标不匹配(Objective Mismatch)的双重影响。我们指出,前者通过适应技术基本可恢复,而后者则导致结构性无法建模复杂的反应性行为,从而构成主要的 OL-CL 差距。我们发现,广泛的 OL 策略学习了一个偏置的 Q 值估计器,忽略了 CL 模拟的反应性特征以及减少累积误差所需的时间感知能力。为此,我们提出了一种测试时适应(Test-Time Adaptation, TTA)框架,用于校准观察迁移、减少状态-动作偏差并强制时间一致性。大量实验表明,TTA 有效缓解了规划偏差,优于基线方法在规模化动态方面具有优势。此外,我们的分析凸显了标准 OL 评估协议中存在的盲点,这些协议未能捕捉闭环部署的现实情况。

关键词

引用

@article{arxiv.2604.10856,
  title  = {BridgeSim: Unveiling the OL-CL Gap in End-to-End Autonomous Driving},
  author = {Seth Z. Zhao and Luobin Wang and Hongwei Ruan and Yuxin Bao and Yilan Chen and Ziyang Leng and Abhijit Ravichandran and Honglin He and Zewei Zhou and Xu Han and Abhishek Peri and Zhiyu Huang and Pranav Desai and Henrik Christensen and Jiaqi Ma and Bolei Zhou},
  journal= {arXiv preprint arXiv:2604.10856},
  year   = {2026}
}