中文

FramePainter: Endowing Interactive Image Editing with Video Diffusion Priors

计算机视觉与模式识别 2025-01-15 v1

摘要

交互式图像编辑允许用户通过诸如绘画、点击和拖动等可视化交互操作来修改图像。现有方法从视频中构建此类监督信号,因为视频捕捉了物体在各种物理交互下的变化。然而,这些模型通常基于文本到图像扩散模型构建,需要(i)大量训练样本和(ii)额外的参考编码器来学习真实世界的动态性和视觉一致性。在本文中,我们将此任务重新表述为图像到视频生成问题,以继承强大的视频扩散先验以减少训练成本并确保时间一致性。具体而言,我们引入FramePainter作为该表述的一种高效实现。 initialized于Stable Video Diffusion,它仅使用轻量级稀疏控制编码器来注入编辑信号。鉴于时间注意力在处理两个帧之间的大位移时存在局限性,我们进一步提出了匹配注意力以扩大感受野并鼓励编辑后图像标记与源图像标记之间稠密对应。我们强调FramePainter在各种编辑信号方面的有效性和效率:它以更少的训练数据显著优于以前的state-of-the-art方法,实现了高度顺畅和连贯的图像编辑,例如自动调整杯子的反射。此外,FramePainter在未出现于真实世界视频的情况下也表现出卓越的泛化能力,例如将小丑鱼转化为类似鲨鱼的形状。我们的代码将在https://github.com/YBYBZhang/FramePainter上提供。

关键词

引用

@article{arxiv.2501.08225,
  title  = {FramePainter: Endowing Interactive Image Editing with Video Diffusion Priors},
  author = {Yabo Zhang and Xinpeng Zhou and Yihan Zeng and Hang Xu and Hui Li and Wangmeng Zuo},
  journal= {arXiv preprint arXiv:2501.08225},
  year   = {2025}
}

备注

Code: https://github.com/YBYBZhang/FramePainter