VistaGEN:基于多视图视觉语言推理实现细粒度控制的一致性驾驶视频生成
计算机视觉与模式识别
2026-03-31 v1
摘要
驾驶视频生成在可控性、视频分辨率和长度方面取得了显著进展,但在保持长视频序列中空间时间一致性的前提下,尚未能支持对多样化驾驶视频进行细粒度的对象级可控性。本文提出了一种新的驾驶视频生成技术,称为VistaGEN,使我们能够在保持空间时间一致性的同时,对特定实体(包括3D物体、图像和文本描述)进行细粒度控制。我们的核心创新在于将多视图视觉语言推理引入长时驾驶视频生成中。为此,我们将视觉语言特征注入多视图视频生成器,以实现细粒度可控性。更重要的是,我们提出了一种多视图视觉语言评估器(MV-VLM),用于智能地自动评估生成内容的空间时间一致性,从而形成一种新的生成-评估-再生闭环生成机制。该机制确保了高质量、连贯的输出,促进了复杂可靠驾驶情景的创建。此外,在闭环生成过程中,我们引入了对象级细化模块,以对来自MV-VLM评估的不满意结果进行细化,然后将其反馈给视频生成器进行再生。广泛的评估表明,我们的VistaGEN能够实现具有细粒度可控性的多样化驾驶视频生成,尤其在长尾物体方面,以及比以前的方法在空间时间一致性方面取得了更好的表现。
引用
@article{arxiv.2603.28353,
title = {VistaGEN: Consistent Driving Video Generation with Fine-Grained Control Using Multiview Visual-Language Reasoning},
author = {Li-Heng Chen and Ke Cheng and Yahui Liu and Lei Shi and Shi-Sheng Huang and Hongbo Fu},
journal= {arXiv preprint arXiv:2603.28353},
year = {2026}
}