何时测试时引导足以完成:基于扩散引导的快速图像与视频编辑
计算机视觉与模式识别
2026-04-01 v2 人工智能
机器学习
摘要
文本驱动的图像和视频编辑可自然地表述为填充问题,其中被遮盖的区域需重建后保持与观察到的内容以及编辑提示的一致性。最近在扩散模型和流模型上进行测试时引导的最新进展为这一任务提供了原则性框架;然而,现有方法依赖昂贵的向量-雅可比积 (VJP) 计算来逼近不可计算的引导项,限制了其实际应用。基于莫法德等人 (2025) 的最近工作,我们提供了其无VJP近似的理论见解,并大幅扩展了其在大规模图像和视频编辑基准测试中的经验评估。我们的结果表明,仅凭测试时引导即可实现与训练性方法相当的性能,甚至在某些情况下超过训练性方法。
引用
@article{arxiv.2602.14157,
title = {When Test-Time Guidance Is Enough: Fast Image and Video Editing with Diffusion Guidance},
author = {Ahmed Ghorbel and Badr Moufad and Navid Bagheri Shouraki and Alain Oliviero Durmus and Thomas Hirtz and Eric Moulines and Jimmy Olsson and Yazid Janati},
journal= {arXiv preprint arXiv:2602.14157},
year = {2026}
}