中文

FreeEdit:基于多模态指令的无掩码参考图像编辑

计算机视觉与模式识别 2024-09-27 v1 人工智能

摘要

引入用户指定的视觉概念进行图像编辑是极为实用的,因为这些概念比基于文本的描述更准确地传达了用户的意图。我们提出一种名为 FreeEdit 的新方法,实现上述参考图像编辑,能够基于用户友好的语言指令准确复现参考图像中的视觉概念。我们的方法利用多模态指令编码器对语言指令进行编码,以引导编辑过程。这种隐式的方式确定编辑区域,无需手动编辑掩码。为增强对参考细节的重建,我们引入 Decoupled Residual ReferAttention (DRRA) 模块。该模块设计用于以残差方式将由细节提取器提取的细粒度参考特征集成到图像编辑过程中,而不会干扰原始自注意力。鉴于现有数据集不适用于参考图像编辑任务,特别是由于难以构建包含参考图像、编辑前图像和编辑后图像的图像三元组, 我们开发了一种新的 twice-repainting 方案,构建了高质量数据集 FreeBench。FreeBench 包含编辑前后的图像、详细的编辑指令以及保持编辑后物体身份的参考图像,涵盖物体添加、替换和删除等任务。通过对 FreeBench 进行分阶段训练并进行质量调优,FreeEdit 能够通过便捷的语言指令实现高质量的零样图编辑。我们进行了广泛的实验,以评估 FreeEdit 在多种任务类型上的有效性,结果表明其优于现有方法。代码将在 https://freeedit.github.io/ 上提供。

关键词

引用

@article{arxiv.2409.18071,
  title  = {FreeEdit: Mask-free Reference-based Image Editing with Multi-modal Instruction},
  author = {Runze He and Kai Ma and Linjiang Huang and Shaofei Huang and Jialin Gao and Xiaoming Wei and Jiao Dai and Jizhong Han and Si Liu},
  journal= {arXiv preprint arXiv:2409.18071},
  year   = {2024}
}

备注

14 pages, 14 figures, project website: https://freeedit.github.io/