MiLA: 用于自动驾驶的多视角高保真长时段视频生成世界模型
计算机视觉与模式识别
2025-03-21 v1
摘要
近年来,数据驱动技术在自动驾驶系统中取得了显著进展,但对稀有且多样化训练数据的需求仍然是一个挑战,需要大量的设备和人力投入。世界模型通过预测和生成未来环境状态来提供一种通过合成带注释视频数据进行训练的有前景的解决方案。然而,现有方法在生成长时间、一致性强的视频时难以避免误差累积,尤其是在动态场景中。为此,我们提出了MiLA框架,用于生成持续时间最长达一分钟的高保真视频。MiLA采用粗到细方法,以稳定视频生成并纠正动态对象的畸变。此外,我们引入了时间分级去噪调度器和联合去噪与纠正流模块,以提高生成视频的质量。在nuScenes数据集上的大量实验表明,MiLA在视频生成质量方面实现了最新技术性能。欲了解更多信息,请访问项目网站:https://github.com/xiaomi-mlab/mila.github.io。
引用
@article{arxiv.2503.15875,
title = {MiLA: Multi-view Intensive-fidelity Long-term Video Generation World Model for Autonomous Driving},
author = {Haiguang Wang and Daqi Liu and Hongwei Xie and Haisong Liu and Enhui Ma and Kaicheng Yu and Limin Wang and Bing Wang},
journal= {arXiv preprint arXiv:2503.15875},
year = {2025}
}
备注
project website: https://github.com/xiaomi-mlab/mila.github.io