ChatBEV:理解 BEV 地图的视觉语言模型
计算机视觉与模式识别
2025-03-24 v2 人工智能
摘要
交通场景理解是智能交通系统和自动驾驶的关键任务,确保车辆安全高效运行。虽然近期视觉语言模型( VLM) 在整体场景理解方面取得了进展,但将 VLM 应用于交通场景,尤其是使用 BEV 地图,仍有待探索。现有方法常因任务设计有限和数据量不足,限制了全面场景理解。为此,我们引入 ChatBEV-QA,一个包含超过 137k 个问题的新型 BEV VQA 基准数据集,旨在涵盖全景理解、车辆-车道交互以及车辆-车辆交互等多种场景理解任务。该基准数据集通过一种新颖的数据收集管道构建,为 BEV 地图生成可扩展且信息丰富的 VQA 数据。我们进一步微调了专用视觉语言模型 ChatBEV,使其能够解释多样化的问句提示,从 BEV 地图中提取相关的上下文感知信息。此外,我们提出了一种语言驱动的交通场景生成管道,ChatBEV 促进地图理解和文本对齐导航指导,显著提升了真实且一致的交通情景生成。该数据集、代码和微调后的模型将予以发布。
引用
@article{arxiv.2503.13938,
title = {ChatBEV: A Visual Language Model that Understands BEV Maps},
author = {Qingyao Xu and Siheng Chen and Guang Chen and Yanfeng Wang and Ya Zhang},
journal= {arXiv preprint arXiv:2503.13938},
year = {2025}
}