Edit Transfer: 基于视觉上下文关系学习图像编辑
计算机视觉与模式识别
2025-07-02 v2
摘要
我们引入了一种新设定——Edit Transfer,在该设定下,模型仅从单一的源-目标示例中学习变换,并将其应用于新的查询图像。基于文本的方法擅长通过文本提示进行语义操作,但通常难以处理精确的几何细节(例如姿态和视角变化)。另一方面,基于参考的编辑通常侧重于风格或外观,且无法进行非刚性变换。通过从源-目标对中显式学习编辑变换,Edit Transfer 缓解了纯文本和以外观为中心的参考方法的局限性。受大语言模型中上下文学习的启发,我们提出了一种视觉关系上下文学习范式,该范式构建于基于 DiT 的文本到图像模型之上。我们将编辑后的示例和查询图像排列成统一的四格拼图,然后应用轻量级 LoRA 微调,以从最少的示例中捕捉复杂的空间变换。尽管仅使用了 42 个训练样本,Edit Transfer 在多种非刚性场景下仍显著优于 SOTA 的 TIE 和 RIE 方法,证明了少样本视觉关系学习的有效性。
引用
@article{arxiv.2503.13327,
title = {Edit Transfer: Learning Image Editing via Vision In-Context Relations},
author = {Lan Chen and Qi Mao and Yuchao Gu and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2503.13327},
year = {2025}
}