图像到视频模型是优秀的零样本图像编辑器吗?
计算机视觉与模式识别
2025-11-26 v2
摘要
大规模视频扩散模型展现出强大的世界模拟与时间推理能力,但其作为零样本图像编辑器的应用仍未被充分探索。我们提出IF-Edit,一个无需微调的框架,将预训练的图像到视频扩散模型重新用于指令驱动的图像编辑。IF-Edit解决三个关键挑战:提示对齐偏差、冗余时间潜变量以及后期帧模糊。具体包括:(1) 一个链式思维提示增强模块,将静态编辑指令转化为具有时间基础的推理提示;(2) 一个时间潜变量丢弃策略,在专家切换点后压缩帧潜变量,在保持语义与时间一致性的同时加速去噪;(3) 一个自一致的后期精化步骤,利用短静态视频轨迹锐化后期帧。在涵盖非刚性编辑、物理与时间推理以及通用指令编辑的四个公开基准上的实验表明,IF-Edit在推理中心任务上表现强劲,同时在通用编辑任务上保持竞争力。本研究为视频扩散模型作为图像编辑器提供了系统性视角,并揭示了统一视频-图像生成推理的简单方法。
引用
@article{arxiv.2511.19435,
title = {Are Image-to-Video Models Good Zero-Shot Image Editors?},
author = {Zechuan Zhang and Zhenyuan Chen and Zongxin Yang and Yi Yang},
journal= {arXiv preprint arXiv:2511.19435},
year = {2025}
}
备注
technical report