驾驶场景的具身理解
计算机视觉与模式识别
2024-03-08 v1
摘要
具身场景理解是自主智能体感知、解释和响应开放驾驶场景的基石。这种理解通常建立在视觉语言模型(VLMs)之上。然而,现有的VLMs局限于2D领域,缺乏空间感知和长时序外推能力。我们重新审视自动驾驶的关键方面并制定了适当的评估准则。为此,我们引入了具身语言模型(ELM),这是一个为智能体理解具有大空间和时间跨度的驾驶场景量身定制的综合框架。ELM结合了空间感知预训练,赋予智能体鲁棒的空间定位能力。此外,该模型采用时间感知token选择以准确询问时间线索。我们在重新制定的多面基准上实例化ELM,它在各个方面都超越了先前最先进的方法。所有代码、数据和模型将公开分享。
引用
@article{arxiv.2403.04593,
title = {Embodied Understanding of Driving Scenarios},
author = {Yunsong Zhou and Linyan Huang and Qingwen Bu and Jia Zeng and Tianyu Li and Hang Qiu and Hongzi Zhu and Minyi Guo and Yu Qiao and Hongyang Li},
journal= {arXiv preprint arXiv:2403.04593},
year = {2024}
}
备注
43 pages, 16 figures