中文

通过自适应低通引导改进图像到视频模型中的运动

计算机视觉与模式识别 2026-02-25 v2

摘要

最近的文本到视频 (T2V) 模型在生成高质量动态视频方面展现出强大的能力。为提高视觉可控性,最近的研究考虑对预训练的 T2V 模型进行微调以支持图像到视频 (I2V) 生成。然而,这种适应性方法常常抑制生成输出的运动动态,导致生成的视频相较于其 T2V 对手更为静态。在本工作中,我们分析了这一现象并确定其根源在于输入图像中高频细节的过早暴露,这导致抽样过程偏向一条过拟合参考图像静态外观的捷径轨迹。为解决此问题,我们提出了自适应低通引导 (Adaptive Low-Pass Guidance, ALG),这是一种简单的训练-free 修复方法,用于改进 I2V 模型的抽样程序以生成更动态的视频,而不会牺牲单帧图像质量。具体而言,ALG 通过在去噪早期阶段对条件图像应用低通滤波来自适应调制条件图像的频率内容。大量实验表明,ALG 显著提高了生成视频的时序动态性,同时保持或甚至提升图像保真度和文本对齐度。例如,在 VBench 测试套件上,ALG 在动态程度方面实现了模型间平均提升 33%,同时保持原始视频质量。有关更多可视化和源代码,请参阅项目页面。

关键词

引用

@article{arxiv.2506.08456,
  title  = {Improving Motion in Image-to-Video Models via Adaptive Low-Pass Guidance},
  author = {June Suk Choi and Kyungmin Lee and Sihyun Yu and Yisol Choi and Jinwoo Shin and Kimin Lee},
  journal= {arXiv preprint arXiv:2506.08456},
  year   = {2026}
}

备注

Project page: http://choi403.github.io/ALG