Delta-Adapter:基于单对示例的可扩展示例驱动图像编辑
计算机视觉与模式识别
2026-05-11 v1
摘要
示例驱动图像编辑将由源-目标图像对定义的变换应用到新查询图像上。现有方法依赖基于两对的监督范例, requiring 两个具有相同编辑语义的图像对来学习目标变换。这种约束使得大规模整理训练数据困难,并限制了在 diverse edit types 上的泛化。我们提出 Delta-Adapter,一种在单对监督下学习可迁移编辑语义的方法,不需要文本指导。不直接将示例对暴露给模型,而是利用预训练视觉编码器提取编码源-目标图像之间语义变化的 delta,将该语义 delta 通过基于 Perceiver 的适配器注入到预训练图像编辑模型中。由于目标图像从未直接可见,模型可作为预测目标,从而在无需额外示例对的前提下实现单对监督。该表述允许我们利用现有的大规模编辑数据集进行训练。为进一步促进变换的可靠传递,我们引入语义 delta 一致性损失,将生成输出的语义变化与来自示例对的真实语义 delta 对齐。大量实验表明,Delta-Adapter 在四个强大基线的四个 seen editing tasks 上显著提高编辑精度和内容一致性,同时在 unseen editing tasks 上实现更好的泛化。代码将在 https://delta-adapter.github.io 提供。
引用
@article{arxiv.2605.07940,
title = {Delta-Adapter: Scalable Exemplar-Based Image Editing with Single-Pair Supervision},
author = {Jiacheng Chen and Songze Li and Han Fu and Baoquan Zhao and Wei Liu and Yanyan Liang and Li Qing and Xudong Mao},
journal= {arXiv preprint arXiv:2605.07940},
year = {2026}
}