中文

UniUGP:统一理解、生成与规划的端到端自动驾驶

计算机视觉与模式识别 2025-12-11 v1

摘要

自动驾驶系统在长尾情形下表现不佳,由于世界知识有限且视觉动态建模不足。现有的基于视觉语言-动作(VLA)的方法无法利用无标签视频进行视觉因果学习,而基于世界模型的方法则缺乏来自大规模语言模型的推理能力。本文构建了多个提供推理和规划注释的专业数据集,用于处理复杂情形。随后提出一种统一的理解-生成-规划框架,命名为 UniUGP,通过混合专家架构将场景推理、未来视频生成和轨迹规划融合。通过整合预训练的视觉语言模型和视频生成模型,UniUGP 利用视觉动态和语义推理来增强规划性能。输入为多帧观察和语言指令,输出为可解释的链式思考推理、物理一致的轨迹以及连贯的未来视频。我们引入四阶段训练策略,逐步构建这些能力,涵盖多个现有的自动驾驶数据集,同时包括我们提出的专业数据集。实验表明,该方法在感知、推理和决策方面实现了最先进的性能,同时在应对挑战性长尾情形时表现出优异的泛化能力。

关键词

引用

@article{arxiv.2512.09864,
  title  = {UniUGP: Unifying Understanding, Generation, and Planing For End-to-end Autonomous Driving},
  author = {Hao Lu and Ziyang Liu and Guangfeng Jiang and Yuanfei Luo and Sheng Chen and Yangang Zhang and Ying-Cong Chen},
  journal= {arXiv preprint arXiv:2512.09864},
  year   = {2025}
}

备注

Project Page: https://seed-uniugp.github.io/