中文

面向具身智能驾驶的大型多模态模型:自动驾驶的下一个前沿?

机器人学 2026-01-21 v3 人工智能

摘要

大型多模态模型的出现为解决自动驾驶中模块化设计的局限性提供了极具前景的技术,这种模块化设计在需要持续环境理解和逻辑推理的开放世界场景中往往表现不佳。此外,具身人工智能通过闭环交互促进策略优化以实现持续学习能力,从而推动自动驾驶向具身智能驾驶发展。然而,若仅依赖 LMM 来增强 EI 驾驶而不进行联合决策,这种能力将受到制约。本文引入了一种新颖的语义与策略双重驱动的混合决策框架来应对这一挑战,以确保持续学习与联合决策。该框架将用于语义理解和认知表示的 LMM 与用于实时策略优化的深度强化学习(DRL)相融合。我们首先介绍了 EI 驾驶和 LMM 的基本原理。此外,我们考察了该框架带来的新兴机遇,涵盖潜在效益和代表性用例。通过实验进行了案例研究,以验证我们的框架在完成变道规划任务中的性能优越性。最后,我们确定了若干赋能 EI 驾驶的未来研究方向,以指导后续工作。

关键词

引用

@article{arxiv.2601.08434,
  title  = {Large Multimodal Models for Embodied Intelligent Driving: The Next Frontier in Self-Driving?},
  author = {Long Zhang and Yuchen Xia and Bingqing Wei and Zhen Liu and Shiwen Mao and Zhu Han and Mohsen Guizani},
  journal= {arXiv preprint arXiv:2601.08434},
  year   = {2026}
}