DVGT-2:面向大规模自动驾驶的视觉-几何-动作模型
计算机视觉与模式识别
2026-04-27 v3 人工智能
机器人学
摘要
端到端自动驾驶已从基于稀疏感知的传统范式演进到视觉-语言-动作(VLA)模型,这些模型侧重于学习语言描述作为辅助任务以促进规划。在本文中,我们提出了一种替代的视觉-几何-动作(VGA)范式,主张稠密三维几何是自动驾驶的关键线索。由于车辆在三维世界中运行,我们认为稠密三维几何为决策提供了最全面的信息。然而,大多数现有的几何重建方法(如 DVGT)依赖对多帧输入进行计算昂贵的批处理,无法应用于在线规划。为此,我们引入了一个流式驾驶视觉几何 Transformer(DVGT-2),它以在线方式处理输入并联合输出当前帧的稠密几何和轨迹规划。我们采用时间因果注意力并缓存历史特征以支持即时推理。为进一步提高效率,我们提出了一种滑动窗口流式策略,并在一定间隔内使用历史缓存以避免重复计算。尽管速度更快,DVGT-2 在各种数据集上仍实现了优越的几何重建性能。同一训练好的 DVGT-2 可直接应用于多样化的相机配置下的规划,无需微调,包括闭环 NAVSIM 和开环 nuScenes 基准测试。
引用
@article{arxiv.2604.00813,
title = {DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale},
author = {Sicheng Zuo and Zixun Xie and Wenzhao Zheng and Shaoqing Xu and Fang Li and Hanbing Li and Long Chen and Zhi-Xin Yang and Jiwen Lu},
journal= {arXiv preprint arXiv:2604.00813},
year = {2026}
}
备注
Code is available at https://github.com/wzzheng/DVGT