中文

EMMA:用于自动驾驶的端到端多模态模型

计算机视觉与模式识别 2025-09-24 v3 人工智能 计算与语言 机器学习 机器人学

摘要

我们介绍 EMMA,这是一个用于自动驾驶的端到端多模态模型。基于类似 Gemini 的多模态大语言模型基础,EMMA 直接将原始相机传感器数据映射到各种驾驶专用输出,包括规划轨迹、感知对象和道路图元素。EMMA 通过将所有非传感器输入(例如导航指令和 ego 车辆状态)和输出(例如轨迹和 3D 位置)表示为自然语言文本,最大化了来自预训练大语言模型的世界知识的效用。这种方法允许 EMMA 在统一的语言空间中联合处理各种驾驶任务,并通过任务特定的提示为每个任务生成输出。经验地,我们通过在 nuScenes 上实现运动规划的领先性能以及在 Waymo Open Motion Dataset(WOMD)上的竞争性结果来展示 EMMA 的有效性。EMMA 也在 Waymo Open Dataset(WOD)上获得了以相机为主的 3D 对象检测的竞争性结果。我们表明,与规划轨迹、对象检测和道路图任务共训练 EMMA 可在所有三个领域获得改进,凸显了 EMMA 作为自动驾驶应用通用模型的潜力。我们希望我们的结果将激发进一步发展自动驾驶模型架构的研究。

关键词

引用

@article{arxiv.2410.23262,
  title  = {EMMA: End-to-End Multimodal Model for Autonomous Driving},
  author = {Jyh-Jing Hwang and Runsheng Xu and Hubert Lin and Wei-Chih Hung and Jingwei Ji and Kristy Choi and Di Huang and Tong He and Paul Covington and Benjamin Sapp and Yin Zhou and James Guo and Dragomir Anguelov and Mingxing Tan},
  journal= {arXiv preprint arXiv:2410.23262},
  year   = {2025}
}

备注

Accepted by TMLR. Blog post: https://waymo.com/blog/2024/10/introducing-emma/