中文

Ouroboros-Diffusion:探索调谨-free 长视频扩散中的一致内容生成

计算机视觉与模式识别 2025-01-16 v1

摘要

基于预训练文本到视频模型的first-in-first-out (FIFO)视频扩散方法最近涌现出一种有效的无调谨长视频生成技术。该技术维护一队列逐渐增加噪声的视频帧,持续在队列头部产生干净帧,同时在队列尾部加入高斯噪声。然而,FIFO-Diffusion由于缺乏跨帧对应建模,往往难以保持生成视频的长程时序一致性。本文提出Ouroboros-Diffusion,一种新的视频去噪框架,旨在增强结构和内容(subject)一致性,实现任意长度视频的一致生成。具体而言,我们在队列尾部引入新的潜在采样技术,以提高结构一致性,确保帧之间感知上的平滑过渡。为增强subject一致性,我们设计了Subject-Aware Cross-Frame Attention (SACFA)机制,在短序列内对齐各帧中的subject,以实现更好的视觉连贯性。此外,我们引入自循环引导技术。该技术利用队列前方所有较干净帧的信息,指导队列后方较噪声帧的去噪,促进丰富且具上下文相关性的全局信息相互作用。在VBench基准上的大量长视频生成实验表明,我们的Ouroboros-Diffusion在subject一致性、运动平滑性和时序一致性方面均表现优异。

关键词

引用

@article{arxiv.2501.09019,
  title  = {Ouroboros-Diffusion: Exploring Consistent Content Generation in Tuning-free Long Video Diffusion},
  author = {Jingyuan Chen and Fuchen Long and Jie An and Zhaofan Qiu and Ting Yao and Jiebo Luo and Tao Mei},
  journal= {arXiv preprint arXiv:2501.09019},
  year   = {2025}
}