中文

3D Tokenized LLM 是可靠自主驾驶的关键吗?

计算机视觉与模式识别 2024-05-29 v1

摘要

自主驾驶(AD)任务的快速进步导致向 end-to-end 方式的重大转变,尤其是利用集成鲁棒逻辑推理和认知能力的视觉语言模型(VLM),以实现全面的 end-to-end 规划。然而,这类 VLM 方法倾向于集成 2D 视觉标记器和大语言模型(LLM)用于 ego-car 规划,这些方法缺乏可靠规划的几何先验。自然地,这引发了一个关键问题:2D-tokenized LLM 能否准确感知 3D 环境?我们的评估表明,当前 VLM 方法在 3D 目标检测、矢量地图构建和环境描述任务上的表现不佳,即答案是“遗憾地否定”。换言之,2D-tokenized LLM 未能提供可靠的自主驾驶。为此,我们引入 DETR 风格的 3D 感知器作为 3D 标记器,将 LLM 与单层线性投影器相连接。这种简单而优雅的策略称为 Atlas,利用 3D 物理世界固有的先验,使其能够同时处理高分辨率多视角图像并采用时空建模。尽管方法简单,Atlas 在 nuScenes 数据集上的 3D 检测和 ego 规划任务中表现优异,证明了 3D-tokenized LLM 是可靠自主驾驶的关键。代码和数据集将公开释放。

关键词

引用

@article{arxiv.2405.18361,
  title  = {Is a 3D-Tokenized LLM the Key to Reliable Autonomous Driving?},
  author = {Yifan Bai and Dongming Wu and Yingfei Liu and Fan Jia and Weixin Mao and Ziheng Zhang and Yucheng Zhao and Jianbing Shen and Xing Wei and Tiancai Wang and Xiangyu Zhang},
  journal= {arXiv preprint arXiv:2405.18361},
  year   = {2024}
}