中文

MICo-150K: 面向多图像合成的综合数据集

计算机视觉与模式识别 2026-04-29 v2

摘要

在可控图像生成中, 从多个参考输入合成连贯且一致的图像, 即多图像合成 (Multi-Image Composition, MICo), 仍是一个具有挑战性的问题, 部分原因是缺乏高质量训练数据。为弥合这一差距, 我们对 MICo 进行系统性研究, 将其分为 7 个具有代表性的任务并筛选大规模高质量源图像并构建多样化的 MICo 提示。利用强大的专有模型, 我们合成丰富的平衡合成图像, 随后进行以人类为中间者的人工筛选与精炼, 得到 MICo-150K, 这是一个用于 MICo 且具有身份一致性的综合数据集。我们进一步构建了分解-重组 (Decomposition-and-Recomposition, De&Re) 子集, 其中 11K 真实世界复杂图像被分解为组件并重组, 实现实验与合成合成的同时支持。为实现全面评估, 我们构建 MICo-Bench, 每个任务包含 100 个案例, 300 个具有挑战性的 De&Re 案例, 并进一步引入新度量 Weighted-Ref-VIEScore, 专为 MICo 评估而设计。最后, 我们在 MICo-150K 上微调多个模型并在 MICo-Bench 上进行评估。结果表明, MICo-150K 有效地为没有 MICo 能力的模型提供能力, 并进一步提升已有技能的模型。值得注意的是, 我们的基线模型 Qwen-MICo 基于 Qwen-Image-Edit 微调, 在 3 图像合成中匹配 Qwen-Image-2509, 同时支持超越后者限制的任意多图像输入。我们的数据集、基准和基线模型共同提供了为进一步研究多图像合成提供的宝贴资源。

关键词

引用

@article{arxiv.2512.07348,
  title  = {MICo-150K: A Comprehensive Dataset Advancing Multi-Image Composition},
  author = {Xinyu Wei and Kangrui Cen and Hongyang Wei and Zhen Guo and Kai Cui and Bairui Li and Zeqing Wang and Jinrui Zhang and Lei Zhang},
  journal= {arXiv preprint arXiv:2512.07348},
  year   = {2026}
}

备注

Project Page: https://MICo-150K.github.io/