NoiseController:通过噪声分解与协作实现一致性多视角视频生成
计算机视觉与模式识别
2025-04-28 v1
摘要
高质量视频生成对于电影行业和自动驾驶等众多领域至关重要。然而,实现视频的时空一致性仍然具有挑战性。当前方法通常利用注意力机制或修改噪声来实现一致性视频,忽略了可能有助于确保视频生成过程中空间和时间一致性的全局时空信息。本文提出了NoiseController,包括多级噪声分解、多帧噪声协作和联合去噪,以增强视频生成的时空一致性。在多级噪声分解中,我们首先将初始噪声分解为场景级前景/背景噪声,以捕获不同运动特性,以建模多视角前景/背景变化。进一步地,将每个场景级噪声分解为individual级共享成分和残差成分。共享噪声保持一致性,而残差成分保持多样性。在多帧噪声协作中,我们引入了视间时空协作矩阵和视内影响协作矩阵,这些矩阵捕获互相的跨视角效应和历史跨帧影响,以增强视频质量。联合去噪包含两个平行去噪U-Net用于去除每个场景级噪声,相互增强视频生成。我们在关注视频生成及下游任务的公开数据集上评估了NoiseController,展示了其领先的性能。
引用
@article{arxiv.2504.18448,
title = {NoiseController: Towards Consistent Multi-view Video Generation via Noise Decomposition and Collaboration},
author = {Haotian Dong and Xin Wang and Di Lin and Yipeng Wu and Qin Chen and Ruonan Liu and Kairui Yang and Ping Li and Qing Guo},
journal= {arXiv preprint arXiv:2504.18448},
year = {2025}
}