中文

Edit Transfer: 基于视觉上下文关系学习图像编辑

计算机视觉与模式识别 2025-07-02 v2

摘要

我们引入了一种新设定——Edit Transfer,在该设定下,模型仅从单一的源-目标示例中学习变换,并将其应用于新的查询图像。基于文本的方法擅长通过文本提示进行语义操作,但通常难以处理精确的几何细节(例如姿态和视角变化)。另一方面,基于参考的编辑通常侧重于风格或外观,且无法进行非刚性变换。通过从源-目标对中显式学习编辑变换,Edit Transfer 缓解了纯文本和以外观为中心的参考方法的局限性。受大语言模型中上下文学习的启发,我们提出了一种视觉关系上下文学习范式,该范式构建于基于 DiT 的文本到图像模型之上。我们将编辑后的示例和查询图像排列成统一的四格拼图,然后应用轻量级 LoRA 微调,以从最少的示例中捕捉复杂的空间变换。尽管仅使用了 42 个训练样本,Edit Transfer 在多种非刚性场景下仍显著优于 SOTA 的 TIE 和 RIE 方法,证明了少样本视觉关系学习的有效性。

关键词

引用

@article{arxiv.2503.13327,
  title  = {Edit Transfer: Learning Image Editing via Vision In-Context Relations},
  author = {Lan Chen and Qi Mao and Yuchao Gu and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2503.13327},
  year   = {2025}
}