Brick-Diffusion:以砖到墙去噪生成长视频
计算机视觉与模式识别
2025-01-07 v1
摘要
扩散模型的最新进展显著提升了文本驱动的视频生成能力。然而,长视频生成模型的训练需要大量计算资源和海量数据,导致大多数视频扩散模型仅限于生成少量帧。现有方法尝试利用预训练的短视频扩散模型以无训练方式生成长视频,但常常面临运动动态不足以及视频保真度下降等问题。本文提出 Brick-Diffusion,一种新颖的无训练方法,能够生成任意长度的长视频。该方法引入砖到墙去噪策略,将潜变量按片段进行去噪,并在后续迭代中采用步长推进。该过程模拟了交错砌筑砖墙的方式,其中每块砖代表一个去噪片段,从而实现帧间通信并提升整体视频质量。通过定量与定性评估,我们证明 Brick-Diffusion 在生成高保真视频方面优于现有基线方法。
引用
@article{arxiv.2501.02741,
title = {Brick-Diffusion: Generating Long Videos with Brick-to-Wall Denoising},
author = {Yunlong Yuan and Yuanfan Guo and Chunwei Wang and Hang Xu and Li Zhang},
journal= {arXiv preprint arXiv:2501.02741},
year = {2025}
}
备注
ICASSP 2025