中文

多主体上下文图像生成的多模态大语言模型

机器学习 2026-04-10 v1

摘要

近期文本到图像(T2I)生成取得了进展,使得从描述中进行视觉连贯的图像合成成为可能,但生成包含多个给定主体的图像仍然具有挑战性。随着参考身份数量的增加,现有方法经常出现主体缺失和语义漂移问题。为解决这一问题,我们提出 MUSIC,这是首个专门用于多主体上下文图像生成的MLLM。为克服数据稀缺问题,我们引入了一个自动且可扩展的数据生成流水线,消除了对人工标注的需求。此外,我们通过视觉思维链(CoT)机制增强了模型对多主体语义关系的理解,引导从主体图像到语义和生成的逐步推理。为缓解身份纠缠并管理视觉复杂性,我们开发了一种新颖的语义驱动的空间布局规划方法,并展示了其测试时规模可扩展性。通过在训练中纳入复杂的主体图像,我们提升了模型的链式推理能力。此外,我们整理了 MSIC,一个专门用于多主体上下文生成的新基准。实验结果表明,MUSIC 在多主体和单主体场景中均显著优于其他方法。

关键词

引用

@article{arxiv.2604.07422,
  title  = {Multimodal Large Language Models for Multi-Subject In-Context Image Generation},
  author = {Yucheng Zhou and Dubing Chen and Huan Zheng and Jianbing Shen},
  journal= {arXiv preprint arXiv:2604.07422},
  year   = {2026}
}

备注

ACL 2026