中文

MPDrive:基于标记提示学习提升自动驾驶的空间理解

计算机视觉与模式识别 2025-04-02 v1

摘要

自动驾驶视觉问答(AD-VQA)旨在基于给定的驾驶场景图像回答关于感知、预测和规划的问题,严重依赖模型的空间理解能力。先前方法通常通过坐标的文本表示来表达空间信息,导致视觉坐标表示与文本描述之间存在语义鸿沟,阻碍了空间信息的准确传递,增加了语言表达的负担。为此,我们提出了一种新的基于标记的提示学习框架(MPDrive),通过简洁的视觉标记表示空间坐标,确保语言表达的一致性,并增强视觉感知和空间表达在 AD-VQA 中的准确性。具体而言,我们通过采用检测专家在目标区域上叠加数值标签来创建标记图像,将复杂的文本坐标生成转化为简单的基于文本的视觉标记预测。此外,我们将原始图像和标记图像融合作为场景级特征,并与检测先验集成以推导实例级特征。通过组合这些特征,我们构建了双层次的视觉提示,用于激发 LLM 的空间感知能力。在 DriveLM 和 CODA-LM 数据集上的大量实验表明,MPDrive 实现了最好的性能,尤其在需要精细空间理解的场景中表现尤为突出。

关键词

引用

@article{arxiv.2504.00379,
  title  = {MPDrive: Improving Spatial Understanding with Marker-Based Prompt Learning for Autonomous Driving},
  author = {Zhiyuan Zhang and Xiaofan Li and Zhihao Xu and Wenjie Peng and Zijian Zhou and Miaojing Shi and Shuangping Huang},
  journal= {arXiv preprint arXiv:2504.00379},
  year   = {2025}
}

备注

Accepted by CVPR 2025