中文

MultiEdit:面向多样且具挑战性任务的指令驱动图像编辑

计算机视觉与模式识别 2025-09-19 v1

摘要

当前指令驱动图像编辑(IBIE)方法在面对具挑战性的编辑任务时表现不佳,因为现有数据集的编辑类型和样本数量有限。此外,传统的数据集构建方法往往包含噪声的图像-标题配对,可能引入偏见并限制模型在复杂编辑场景中的能力。为此,我们引入 MultiEdit,一个包含超过 107K 高质量图像编辑样本的全面数据集。该数据集通过 18 种非风格迁移编辑类型和 38 种风格迁移操作,涵盖从高级风格迁移到复杂语义操作(如人物参考编辑和图像内文本编辑)等 6 项具挑战性的编辑任务。我们采用一种新颖的数据集构建管道,利用两个多模态大语言模型(MLLM)分别生成视觉自适应编辑指令和高保真编辑图像。大量实验表明,使用我们提出的 MultiEdit-Train 数据集对基础开源模型进行微调,可在我们提出的 MultiEdit-Test 基准上显著提升模型在复杂编辑任务上的性能,同时有效保留其在标准编辑基准上的能力。我们认为 MultiEdit 为推动 IBIE 具备更具多样性和挑战性的能力研究提供了宝贵资源。我们的数据集可在 https://huggingface.co/datasets/inclusionAI/MultiEdit 访问。

关键词

引用

@article{arxiv.2509.14638,
  title  = {MultiEdit: Advancing Instruction-based Image Editing on Diverse and Challenging Tasks},
  author = {Mingsong Li and Lin Liu and Hongjun Wang and Haoxing Chen and Xijun Gu and Shizhan Liu and Dong Gong and Junbo Zhao and Zhenzhong Lan and Jianguo Li},
  journal= {arXiv preprint arXiv:2509.14638},
  year   = {2025}
}