历史引导的视频扩散
机器学习
2025-07-25 v2 计算机视觉与模式识别
摘要
分类器自由引导 (CFG) 是提高扩散模型条件生成效果的关键技术,能够实现更精确的控制同时提升样本质量。将此技术扩展到视频扩散中(即生成条件于可变数量上下文帧的视频)是自然的做法,这些帧统称为历史。然而,我们发现使用可变长度历史进行引导的两个关键挑战:仅支持固定大小条件的架构,以及 CFG 风格的历史 dropout 在实际中的表现不佳。为此,我们提出了扩散强制转换器 (DFoT),一种视频扩散架构和理论依据的训练目标,使其能够对可变数量的历史帧进行条件化。我们随后引入历史引导,一族由 DFoT 独特启发的引导方法。我们显示,其最简单的形式,即 vanilla 历史引导,已经显著提高了视频生成质量和时间一致性。更高级的方法——时间和频率上的历史引导——进一步增强了运动动力学,使其能够对超出分布的历史实现成分性泛化,并且能够稳定地生成极长视频。项目网站: https://boyuan.space/history-guidance
引用
@article{arxiv.2502.06764,
title = {History-Guided Video Diffusion},
author = {Kiwhan Song and Boyuan Chen and Max Simchowitz and Yilun Du and Russ Tedrake and Vincent Sitzmann},
journal= {arXiv preprint arXiv:2502.06764},
year = {2025}
}
备注
ICML 2025. Project website: https://boyuan.space/history-guidance