中文

ADriver-I:一种用于自动驾驶的通用世界模型

计算机视觉与模式识别 2023-11-23 v1 机器人学

摘要

通常,自动驾驶采用模块化设计,将整个技术栈划分为感知、预测、规划与控制等部分。尽管具有可解释性,这种模块化设计往往引入大量冗余。近来,多模态大语言模型(MLLM)与扩散技术已在理解与生成能力上展现出优越性能。本文首次引入交错视觉-动作对的概念,统一了视觉特征与控制信号的格式。基于视觉-动作对,我们构建了一个基于 MLLM 与扩散模型的自动驾驶通用世界模型,称为 ADriver-I。它以视觉-动作对作为输入,自回归地预测当前帧的控制信号。生成的控制信号与历史视觉-动作对进一步作为条件用于预测未来帧。借助预测出的下一帧,ADriver-I 进行进一步的控制信号预测。该过程可无限重复,ADriver-I 在自身创造的世界中实现自动驾驶。我们在 nuScenes 与大规模私有数据集上进行了大量实验。与若干构建的基线相比,ADriver-I 展现出令人印象深刻的性能。希望我们的 ADriver-I 能为未来自动驾驶与具身智能提供一些新见解。

关键词

引用

@article{arxiv.2311.13549,
  title  = {ADriver-I: A General World Model for Autonomous Driving},
  author = {Fan Jia and Weixin Mao and Yingfei Liu and Yucheng Zhao and Yuqing Wen and Chi Zhang and Xiangyu Zhang and Tiancai Wang},
  journal= {arXiv preprint arXiv:2311.13549},
  year   = {2023}
}

备注

Tech Report