VGGDrive:基于跨视图几何 grounding 为自动驾驶赋能的视觉语言模型
计算机视觉与模式识别
2026-02-25 v1
摘要
跨视图3D几何建模能力对自动驾驶至关重要,然而现有的视觉语言模型(VLM)本质上缺乏这一能力,导致其表现平平。虽然一些有前景的做法试图通过构建Q&A数据进行辅助训练,但仍未从根本上使VLM具备处理多样化评估协议的能力。因此,我们开辟了新道路,主张将成熟的3D基础模型的跨视图几何 grounding 注入VLM,以弥合这一关键能力缺口。在此精神下,我们提出了一种新型架构,VGGDrive,为自动驾驶提供跨视图几何 grounding 能力。具体而言,为将冻结的视觉3D模型中的跨视图3D几何特征与VLM的2D视觉特征进行桥接,我们引入了一种即插即用的跨视图3D几何启用器(CVGE)。CVGE解耦了基础VLM架构,有效地通过层次化自适应注入机制赋能VLM具备3D特征。大量实验表明,VGGDrive在五个自动驾驶基准测试中提升了基础VLM性能,包括跨视图风险感知、运动预测和轨迹规划等任务。我们坚信,成熟的3D基础模型可以通过有效集成来赋能自动驾驶任务,我们希望本次初始探索能为自动驾驶社区展示这一范式的潜力。
引用
@article{arxiv.2602.20794,
title = {VGGDrive: Empowering Vision-Language Models with Cross-View Geometric Grounding for Autonomous Driving},
author = {Jie Wang and Guang Li and Zhijian Huang and Chenxu Dang and Hangjun Ye and Yahong Han and Long Chen},
journal= {arXiv preprint arXiv:2602.20794},
year = {2026}
}
备注
CVPR 2026