视频扩散模型中的等变性及快速采样:基于扭曲噪声训练
计算机视觉与模式识别
2025-10-17 v2 人工智能
摘要
时间一致的逐视频生成对于风格迁移和上采样等应用至关重要。本文对扭曲噪声——一种近期提出的视频扩散模型训练技术——进行了理论分析,并证明将其与标准去噪目标结合使用,会隐式地训练模型对输入噪声的空间变换具有等变性,我们将其称为 EquiVDM。这种等变性使得输入噪声中的运动能够自然地与生成视频中的运动对齐,从而产生连贯且高保真的输出,无需专门的模块或辅助损失。另一大优势是采样效率:EquiVDM 能以远更少的采样步数达到相当或更优的质量。当蒸馏为单步学生模型时,EquiVDM 保留了等变性,并在运动可控性和保真度方面优于蒸馏后的非等变基线。在多个基准测试中,EquiVDM 在运动对齐、时间一致性和感知质量方面始终优于先前方法,同时显著降低了采样成本。
引用
@article{arxiv.2504.09789,
title = {On Equivariance and Fast Sampling in Video Diffusion Models Trained with Warped Noise},
author = {Chao Liu and Arash Vahdat},
journal= {arXiv preprint arXiv:2504.09789},
year = {2025}
}