UniMLVG:面向自动驾驶的统一多视角长时视频生成框架
计算机视觉与模式识别
2025-03-07 v3
摘要
多样化且真实的驾驶情景的创建已成为增强自动驾驶系统感知与规划能力的关键需求。然而,生成持续的、全景视角一致的驾驶视频仍是一个重大挑战。为此,我们提出 UniMLVG,一个统一的框架,用于在精确控制下生成扩展街道多视角视频。通过将单视角和多视角驾驶视频整合到训练数据中,我们的方法更新了一个基于 DiT 的扩散模型,配合跨帧和跨视图模块,经历三个阶段的多目标训练,显著提升了生成视觉内容的多样性和质量。重要的是,我们提出了一种创新的显式视点建模方法,用于多视角视频生成,以有效提高运动过渡一致性。能够处理 various 输入参考格式(如文本、图像或视频),我们的 UniMLVG 可根据相应的条件约束生成高质量的多视角视频,如 3D 边界框或帧级文本描述。与具有类似能力的最佳模型相比,我们的框架在 FID 和 FVD 上分别实现了 48.2% 和 35.2% 的改进。
引用
@article{arxiv.2412.04842,
title = {UniMLVG: Unified Framework for Multi-view Long Video Generation with Comprehensive Control Capabilities for Autonomous Driving},
author = {Rui Chen and Zehuan Wu and Yichen Liu and Yuxin Guo and Jingcheng Ni and Haifeng Xia and Siyu Xia},
journal= {arXiv preprint arXiv:2412.04842},
year = {2025}
}