CoNo: 用于无调优长视频扩散的一致性噪声注入
计算机视觉与模式识别
2024-06-10 v1
摘要
无调优长视频扩散已被提出,通过重用预训练短视频扩散模型的知识而无需重新训练,生成具有丰富内容的延长时长视频。然而,大多数工作忽略了细粒度的长期视频一致性建模,导致场景一致性有限(即不合理的物体或背景过渡),尤其是在多个文本输入的情况下。为了缓解这一问题,我们提出了一致性噪声注入(CoNo),它引入了“回看”机制来增强不同视频片段之间的细粒度场景过渡,并设计了长期一致性正则化,通过噪声预测来消除扩展视频内容时的内容偏移。具体来说,“回看”机制将噪声调度过程分解为三个基本部分,其中一个内部噪声预测部分被注入到两个视频扩展部分中,旨在实现两个视频片段之间的细粒度过渡。长期一致性正则化专注于显式最小化扩展视频片段与原始视频片段预测噪声之间的像素级距离,从而防止突然的场景过渡。大量实验表明,上述策略在单文本和多文本提示条件下进行长视频生成时是有效的。项目已发布在 https://wxrui182.github.io/CoNo.github.io/。
引用
@article{arxiv.2406.05082,
title = {CoNo: Consistency Noise Injection for Tuning-free Long Video Diffusion},
author = {Xingrui Wang and Xin Li and Zhibo Chen},
journal= {arXiv preprint arXiv:2406.05082},
year = {2024}
}
备注
21 pages