OccLLaMA:用于自动驾驶的占用-语言-动作生成式世界模型
计算机视觉与模式识别
2024-09-06 v1 机器人学
摘要
多模态大型语言模型 的兴起推动了其在自动驾驶中的应用。近期基于 MLLM 的方法通过学习从感知到动作的直接映射来执行动作,忽略了世界的动态特性以及动作与世界动态之间的关系。相比之下,人类拥有世界模型,使其能够基于三维内部视觉表征模拟未来状态并据此规划动作。为此,我们提出了 OccLLaMA,一种占用-语言-动作生成式世界模型,它使用语义占用作为通用的视觉表征,并通过自回归模型统一视觉-语言-动作 (VLA) 模态。具体而言,我们引入了一种新颖的类 VQVAE 场景分词器,考虑到语义占用场景的稀疏性和类别不平衡,以高效地离散化和重建语义占用场景。然后,我们为视觉、语言和动作构建了统一的多模态词表。此外,我们增强了 LLM(具体为 LLaMA),以在统一词表上执行下一个 token/场景预测,从而完成自动驾驶中的多项任务。大量实验表明,OccLLaMA 在多项任务中取得了有竞争力的性能,包括 4D 占用预测、运动规划和视觉问答,展示了其作为自动驾驶基础模型的潜力。
引用
@article{arxiv.2409.03272,
title = {OccLLaMA: An Occupancy-Language-Action Generative World Model for Autonomous Driving},
author = {Julong Wei and Shanshuai Yuan and Pengfei Li and Qingda Hu and Zhongxue Gan and Wenchao Ding},
journal= {arXiv preprint arXiv:2409.03272},
year = {2024}
}