中文

MACRO:用于多参考图像生成的结构化长情境数据的 advances

计算机视觉与模式识别 2026-03-27 v1

摘要

生成以多个视觉参考为条件的图像对于现实世界的应用(如多主体构图、叙事插图和新视角合成)至关重要,但当前模型在输入参考图像数量增加时会严重性能下降。我们识别到根本原因是数据瓶颈:现有数据集以单或少量参考对为主,缺乏结构化的长情境监督以学习稠密的参考间依赖关系。为此,我们引入MacroData,一个包含40万个样本的数据集,每个样本最多包含10个参考图像,系统地跨四个互补维度组织——定制、插图、空间推理和时间动态——以提供对多参考生成空间的全面覆盖。鉴于缺乏标准化的评估协议,我们进一步提出了MacroBench,一个包含4000个样本的基准,评估生成在不同任务维度和输入规模下的生成一致性。大量实验表明,在MacroData上进行微调可显著提高多参考生成效果,消融研究进一步揭示了跨任务联合训练的协同效应以及处理长情境复杂度的有效策略。该数据集和基准将对外公开发布。

关键词

引用

@article{arxiv.2603.25319,
  title  = {MACRO: Advancing Multi-Reference Image Generation with Structured Long-Context Data},
  author = {Zhekai Chen and Yuqing Wang and Manyuan Zhang and Xihui Liu},
  journal= {arXiv preprint arXiv:2603.25319},
  year   = {2026}
}

备注

Project Page: https://macro400k.github.io/