中文

FreeSpec:通过奇异谱重建实现免训练长视频生成

计算机视觉与模式识别 2026-05-08 v1

摘要

视频扩散模型在短视频合成中表现良好,但其免训练扩展到长视频时常常出现内容漂移、时间不一致和过度平滑的动态。现有方法通过结合全局分支和局部分支来提高时间一致性,但它们通常在每个分支内使用预定义标准进一步分解外观一致性和时间动态。当外观和动作进展紧密耦合时(例如在摄像机运动和顺序运动中),这种分配是不可靠的。我们从奇异谱的角度分析了视频时间扩展问题,并表明扩大的自注意力窗口会导致谱集中:谱能量由少数低秩奇异方向主导,保留了粗糙结构但抑制了高秩空间细节和富含运动的时间变化。为了缓解这个问题,我们提出了 FreeSpec,一个用于长视频生成的免训练谱重建框架。FreeSpec 用奇异值分解分解全局和局部特征,并使用全局分支作为低秩谱指导,局部分支作为高秩重建基础。这种谱级融合避免了先前分解规则的刚性特征划分,在保持长程一致性的同时更好地保留了空间细节和时间动态。在 Wan2.1 和 LTX-Video 上的实验表明,FreeSpec 改进了长视频生成,特别是在时间动态方面,同时保持了强大的视觉质量和时间一致性。项目演示:https://fdchen24.github.io/FreeSpec-Website/

关键词

引用

@article{arxiv.2605.06509,
  title  = {FreeSpec: Training-Free Long Video Generation via Singular-Spectrum Reconstruction},
  author = {Fangda Chen and Shanshan Zhao and Longrong Yang and Chuanfu Xu and Zhigang Luo and Long Lan},
  journal= {arXiv preprint arXiv:2605.06509},
  year   = {2026}
}