中文

基于寄存器的自动驾驶

计算机视觉与模式识别 2026-02-04 v2 人工智能 机器人学

摘要

我们提出了 DrivoR,一种用于端到端自动驾驶的简单高效的基于 Transformer 的架构。我们的方法建立在预训练的 Vision Transformer(ViT)之上,并引入了相机感知的寄存器 token,将多相机特征压缩为紧凑的场景表示,在不牺牲精度的情况下显著减少了下游计算量。这些 token 驱动两个轻量级 Transformer 解码器,分别生成候选轨迹并对其进行评分。评分解码器学习模仿预言机,并预测可解释的子分数,代表安全性、舒适性和效率等方面,从而在推理时实现行为条件驾驶。尽管其设计极简,DrivoR 在 NAVSIM-v1、NAVSIM-v2 以及照片级真实感闭环 HUGSIM 基准上均优于或匹敌强大的当代基线。我们的结果表明,纯 Transformer 架构结合有针对性的 token 压缩,足以实现准确、高效且自适应的端到端驾驶。代码和检查点将通过项目页面提供。

关键词

引用

@article{arxiv.2601.05083,
  title  = {Driving on Registers},
  author = {Ellington Kirby and Alexandre Boulch and Yihong Xu and Yuan Yin and Gilles Puy and Éloi Zablocki and Andrei Bursuc and Spyros Gidaris and Renaud Marlet and Florent Bartoccioni and Anh-Quan Cao and Nermin Samet and Tuan-Hung VU and Matthieu Cord},
  journal= {arXiv preprint arXiv:2601.05083},
  year   = {2026}
}