FreePCA:通过主成分分析在免训练长视频生成中整合长短帧间一致性信息
计算机视觉与模式识别
2025-05-05 v1
摘要
长视频生成涉及使用在短视频上训练的模型来生成扩展视频,这会因帧数变化而遭受分布偏移。这需要利用原始短视频的局部信息来增强视觉和运动质量,并利用整个长视频的全局信息来确保外观一致性。现有的免训练方法难以有效整合两者的优势,因为视频中的外观和运动紧密耦合,导致运动不一致和视觉质量下降。在本文中,我们揭示了通过应用主成分分析 (PCA),全局和局部信息可以被精确解耦为一致的外观和运动强度信息,从而实现全局一致性和局部质量的精细化互补整合。基于这一洞察,我们提出了 FreePCA,这是一种基于 PCA 的免训练长视频生成范式,可同时实现高一致性和高质量。具体而言,我们通过测量主成分空间中的余弦相似度来解耦一致的外观和运动强度特征。关键的是,我们逐步整合这些特征以保持原始质量并确保平滑过渡,同时通过重用初始噪声的均值统计量来进一步增强一致性。实验表明,FreePCA 可应用于各种视频扩散模型,无需训练即可带来显著改进。代码可在 https://github.com/JosephTiTan/FreePCA 获取。
引用
@article{arxiv.2505.01172,
title = {FreePCA: Integrating Consistency Information across Long-short Frames in Training-free Long Video Generation via Principal Component Analysis},
author = {Jiangtong Tan and Hu Yu and Jie Huang and Jie Xiao and Feng Zhao},
journal= {arXiv preprint arXiv:2505.01172},
year = {2025}
}
备注
Accepted by CVPR 2025