中文

从提示到渐变:驯服视频扩散模型以实现无缝属性过渡

计算机视觉与模式识别 2025-09-25 v1

摘要

现有模型在处理复杂的时间变化时常常遇到困难,尤其是在生成具有渐变属性过渡的视频时。用于运动过渡的最常见的提示插值方法通常无法处理渐变属性过渡,其中不一致性往往会变得更加明显。在这项工作中,我们提出了一种简单而有效的方法,通过去噪过程中引入逐帧引导,来扩展现有模型以实现平滑且一致的属性过渡。我们的方法为每个噪声潜在变量构建一个数据特定的过渡方向,逐帧引导从初始属性到最终属性的渐变转变,同时保留视频的运动动力学。此外,我们提出了受控属性过渡基准 (CAT-Bench),它整合了属性和运动动力学,以全面评估不同模型的性能。我们进一步提出了两个指标来评估属性过渡的准确性和平滑性。实验结果表明,我们的方法在视觉保真度、保持与文本提示的对齐以及实现无缝属性过渡方面,均优于现有基线。代码和 CATBench 已发布:https://github.com/lynn-ling-lo/Prompt2Progression。

关键词

引用

@article{arxiv.2509.19690,
  title  = {From Prompt to Progression: Taming Video Diffusion Models for Seamless Attribute Transition},
  author = {Ling Lo and Kelvin C. K. Chan and Wen-Huang Cheng and Ming-Hsuan Yang},
  journal= {arXiv preprint arXiv:2509.19690},
  year   = {2025}
}

备注

ICCV 2025