中文

RelationAdapter:基于 Diffusion Transformer 的视觉关系学习与迁移

计算机视觉与模式识别 2025-06-04 v1

摘要

受大语言模型 (LLM) 上下文学习机制的启发,一种基于可泛化视觉提示的图像编辑新范式正在兴起。现有的单参考方法通常侧重于风格或外观调整,难以处理非刚性变换。为解决这些局限性,我们提出利用源-目标图像对来提取内容感知的编辑意图,并将其迁移至新的查询图像。为此,我们引入了 RelationAdapter,这是一个轻量级模块,使基于 Diffusion Transformer (DiT) 的模型能够从少量样本中有效捕捉并应用视觉变换。我们还引入了 Relation252K,一个包含 218 项不同编辑任务的综合数据集,用于评估模型在视觉提示驱动场景下的泛化能力和适应性。在 Relation252K 上的实验表明,RelationAdapter 显著提升了模型理解和迁移编辑意图的能力,在生成质量和整体编辑性能上均取得了显著提升。

关键词

引用

@article{arxiv.2506.02528,
  title  = {RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers},
  author = {Yan Gong and Yiren Song and Yicheng Li and Chenglin Li and Yin Zhang},
  journal= {arXiv preprint arXiv:2506.02528},
  year   = {2025}
}