中文

Talk2BEV:面向自动驾驶的语言增强鸟瞰图地图

计算机视觉与模式识别 2023-11-15 v2 机器人学

摘要

Talk2BEV 是一个用于自动驾驶场景中鸟瞰图(BEV)地图的大型视觉-语言模型(LVLM)接口。尽管现有的自动驾驶场景感知系统主要聚焦于预定义(封闭)的物体类别和驾驶场景,Talk2BEV 将通用语言与视觉模型的最新进展与 BEV 结构化地图表示相融合,消除了对特定任务模型的需求。这使得单一系统能够应对多种自动驾驶任务,包括视觉与空间推理、预测交通参与者的意图,以及基于视觉线索的决策。我们在大量场景理解任务上对 Talk2BEV 进行了广泛评估,这些任务既依赖于解释自由形式自然语言查询的能力,也依赖于将这些查询 grounding 到嵌入语言增强 BEV 地图的视觉上下文中。为促进自动驾驶场景中 LVLM 的进一步研究,我们开发并发布了 Talk2BEV-Bench,一个包含 1000 个人工标注 BEV 场景的基准,带有来自 NuScenes 数据集的超过 20000 个问题与真值回答。

关键词

引用

@article{arxiv.2310.02251,
  title  = {Talk2BEV: Language-enhanced Bird's-eye View Maps for Autonomous Driving},
  author = {Tushar Choudhary and Vikrant Dewangan and Shivam Chandhok and Shubham Priyadarshan and Anushka Jain and Arun K. Singh and Siddharth Srivastava and Krishna Murthy Jatavallabhula and K. Madhava Krishna},
  journal= {arXiv preprint arXiv:2310.02251},
  year   = {2023}
}

备注

Project page at https://llmbev.github.io/talk2bev/