FreeLong++: 基于多带谱融合的无训练长视频生成
计算机视觉与模式识别
2025-07-02 v1
摘要
近期视频生成模型的进展已实现了从文本提示生成高质量短视频,但将这些模型扩展到更长视频仍是重大挑战,主要由于时间一致性和视觉保真度下降。我们的初步观察表明,粗糙地将短视频生成模型应用于更长序列会导致显著的质量下降。进一步分析识别出一种系统性趋势:随着视频长度增长,高频分量越来越受损,我们称之为高频失真。为此,我们提出了 FreeLong,一个旨在在去噪过程中平衡长视频特征频率分布的无训练框架。FreeLong 通过将捕获整个视频整体语义的全局低频特征与从短时间窗口中提取的局部高频特征混合,以实现频率分布的平衡。建立在此基础上,FreeLong++ 将 FreeLong 的双分支设计扩展为多分支架构,多个注意力分支分别在不同的时间尺度上运行。通过将多个窗口大小从全局到局部排列,FreeLong++ 实现了从低频到高频的多带频率融合,确保在更长的视频序列中保持语义连续性和细粒度运动动态。无需任何额外训练,FreeLong++ 可直接集成到现有的视频生成模型(如 Wan2.1 和 LTX-Video)中,以生成质量显著提升的长视频。我们展示了该方法在更长视频生成任务(例如 4 倍和 8 倍原始长度)中优于先前方法。它还支持带有平滑场景过渡的多提示视频生成,并可使用长深度或姿态序列实现可控视频生成。
引用
@article{arxiv.2507.00162,
title = {FreeLong++: Training-Free Long Video Generation via Multi-band SpectralFusion},
author = {Yu Lu and Yi Yang},
journal= {arXiv preprint arXiv:2507.00162},
year = {2025}
}
备注
under review