基于适配器模块的扩散视频编辑中高效时间一致性:理论框架
统计力学
2025-09-26 v1
摘要
适配器方法常用于在最小额外复杂度的前提下增强模型性能,尤其是那些需要帧间一致性的视频编辑任务。通过在预训练扩散模型中插入小型可学习模块,这些适配器可以在不进行大量再训练的情况下维持时间一致性。那些结合提示学习的做法,同时使用共享和帧特定的标记,能够在低训练成本下有效保持跨帧的连续性。在本工作中,我们提供了一个维护DDIM模型中帧一致性适配器的时间一致性损失的通用理论框架。首先,我们证明了时间一致性目标在受限特征范数下的可微,确立了其梯度的 Lipschitz 界限。其次,我们展示了对该目标进行的梯度下降在学习率在适当范围内时,可单调减少损失并收敛到局部最小值。最后,我们分析了DDIM反向程序中模块的稳定性,表明相关误差可控。这些理论发现将强化依赖适配器策略的基于扩散的视频编辑方法的可靠性,并为视频生成任务提供理论见解。
引用
@article{arxiv.2504.16015,
title = {From observed transitions to hidden paths in Markov networks},
author = {Alexander M. Maier and Udo Seifert and Jann van der Meer},
journal= {arXiv preprint arXiv:2504.16015},
year = {2025}
}