中文

X2Edit:通过自构建数据和任务感知表示学习重审任意指令图像编辑

计算机视觉与模式识别 2025-11-11 v2

摘要

现有的用于任意指令图像编辑的开源数据集仍不理想,而一个与社区流行的生成模型兼容的即插即用编辑模块也明显缺失。在本文中,我们首先介绍了 X2Edit 数据集,这是一个涵盖 14 种不同编辑任务(包括主题驱动生成)的综合性数据集。我们利用业界领先的统一图像生成模型和专家模型来构建数据。同时,我们使用 VLM 设计合理的编辑指令,并实施多种评分机制来过滤数据。最终,我们构建了 370 万条类别平衡的高质量数据。其次,为了更好地与社区图像生成模型无缝集成,我们基于 FLUX.1 设计了任务感知的 MoE-LoRA 训练,仅使用完整模型 8% 的参数。为了进一步提高最终性能,我们利用扩散模型的内部表示,并根据图像编辑类型定义正/负样本以引入对比学习。大量实验表明,该模型的编辑性能在众多优秀模型中具有竞争力。此外,构建的数据集相比现有开源数据集展现出显著优势。X2Edit 的开源代码、检查点和数据集可在以下链接找到:https://github.com/OPPO-Mente-Lab/X2Edit。

关键词

引用

@article{arxiv.2508.07607,
  title  = {X2Edit: Revisiting Arbitrary-Instruction Image Editing through Self-Constructed Data and Task-Aware Representation Learning},
  author = {Jian Ma and Xujie Zhu and Zihao Pan and Qirong Peng and Xu Guo and Chen Chen and Haonan Lu},
  journal= {arXiv preprint arXiv:2508.07607},
  year   = {2025}
}

备注

Accepted to AAAI 2026