中文

ScaleEdit-12M:通过多主体框架扩展开源图像编辑数据生成

计算机视觉与模式识别 2026-03-25 v2

摘要

基于指令的图像编辑已成为统一多模态模型(UMMs)的关键能力,但在不依赖高成本专有API的情况下构建大规模、多样且高质量编辑数据集 remains 挑战。以往的图像编辑数据集要么依赖封闭式模型进行标注,无法实现成本效益的规模化,要么采用固定的合成编辑管道, suffers from limited quality and generalizability。为此,我们提出ScaleEditor:一个完全开源的层次化多主体框架,用于从头到尾构建大规模、高质量图像编辑数据集。我们的管道包括三个关键组件:源图像扩展与世界知识融合、自适应多主体编辑指令-图像合成、以及任务感知的数据质量验证机制。通过ScaleEditor,我们策划了ScaleEdit-12M,目前最大规模的开源图像编辑数据集,覆盖23个任务家族,涵盖多样化的真实和合成领域。对UniWorld-V1和Bagel进行微调,结果在通用编辑基准测试中分别在ImgEdit和GEdit上提升最高可达10.4%和35.1%,在知识感知基准测试中在RISE和KRIS-Bench上提升最高可达150.0%和26.5%。这些结果表明,开源且代理式的管道能够在保持成本效益和可扩展性的同时接近商业水平的数据质量。该框架和数据集将开源。

关键词

引用

@article{arxiv.2603.20644,
  title  = {ScaleEdit-12M: Scaling Open-Source Image Editing Data Generation via Multi-Agent Framework},
  author = {Guanzhou Chen and Erfei Cui and Changyao Tian and Danni Yang and Ganlin Yang and Yu Qiao and Hongsheng Li and Gen Luo and Hongjie Zhang},
  journal= {arXiv preprint arXiv:2603.20644},
  year   = {2026}
}