FreeLong:基于谱混合时序注意力的无训练长视频生成
计算机视觉与模式识别
2024-07-30 v1
摘要
视频扩散模型在各类视频生成应用中取得了显著进展。然而,为长视频生成任务训练模型需要巨大的计算和数据资源,这对 developing 长视频扩散模型构成挑战。本文探讨了一种直截了当且无需训练的方案,旨在将现有的短视频扩散模型(例如预训练于16帧视频)扩展至一致的长视频生成(例如128帧)。我们的初步观察发现,直接将短视频扩散模型用于生成长视频会导致严重的视频质量下降。进一步的调查表明,这种下降主要源于长视频中高频分量的失真,具体表现为空间高频分量减少和时间高频分量增加。基于此,我们提出了一种名为 FreeLong 的新方案,通过在去噪过程中平衡长视频特征的频率分布。FreeLong 将全局视频特征的低频分量(封装整个视频序列)与局部视频特征的高频分量(聚焦于较短的帧子序列)进行混合。该方法在保持全局一致性的同时,融合了来自局部视频中多样且高质量的时空细节,增强了长视频生成的一致性和保真度。我们在多个基础视频扩散模型上进行了评估,观察到显著的改进。此外,我们的方法支持一致的多提示生成,确保视觉连贯性以及场景之间的无缝衔接。
引用
@article{arxiv.2407.19918,
title = {FreeLong: Training-Free Long Video Generation with SpectralBlend Temporal Attention},
author = {Yu Lu and Yuanzhi Liang and Linchao Zhu and Yi Yang},
journal= {arXiv preprint arXiv:2407.19918},
year = {2024}
}
备注
Project page: https://yulu.net.cn/freelong