LongDiff:一种无需训练的全流程长视频生成方法
计算机视觉与模式识别
2025-03-25 v1
摘要
视频扩散模型最近在视频生成方面取得了显著的成绩。尽管这些模型表现令人鼓舞,但大多数模型主要设计和训练用于短视频生成,导致在长视频生成中难以维持时间一致性和视觉细节。本文提出了 LongDiff,一种新颖的无需训练的方法,包含精心设计的组件——位置映射(Position Mapping, PM)和信息丰富帧选择(Informative Frame Selection, IFS)——以解决阻碍短视频到长视频生成泛化的两个关键挑战:时间位置模糊和信息稀释。我们的 LongDiff 能够发掘即插即用视频扩散模型的潜力,实现一次性生成高质量的长视频。大量实验表明,我们的方法有效。
引用
@article{arxiv.2503.18150,
title = {LongDiff: Training-Free Long Video Generation in One Go},
author = {Zhuoling Li and Hossein Rahmani and Qiuhong Ke and Jun Liu},
journal= {arXiv preprint arXiv:2503.18150},
year = {2025}
}