中文

通过统一生成模型中的多模态链思 (MCoT) 实现图像生成提升

计算机视觉与模式识别 2025-12-23 v3 人工智能

摘要

统一生成模型在文本和图像生成方面表现突出。对于图像合成任务,它们采用直观的文本到图像 (T2I) 生成方式。然而,直观的 T2I 生成方式限制了模型处理复杂组合指令的能力,而这些指令在现实场景中经常出现。虽然这一问题至关重要,但现有工作主要关注提高模型的基础图像生成能力。虽然这些改进在某种程度上有所帮助,但仍未充分解决问题。灵感来源于链思 (CoT) 按步骤解决复杂问题的思路,本工作旨在将 CoT 引入统一生成模型,以解决直观 T2I 生成难以有效处理的复杂图像生成挑战,从而赋予模型增强的图像生成能力。为此,我们首先提出功能导向专家 (FoXperts),在我们模型 FoX 中构建专家并行架构,按功能分配专家。FoXperts 解耦了主流模块导向设计中的潜在冲突,为 CoT 提供了坚实基础。引入 CoT 后,第一个问题是如何为复杂图像生成设计其结构。为此,我们模拟人类类似的艺术工作流程——规划、行动、反思和纠正——提出多模态链思 (MCoT) 方法,因数据涉及文本和图像。为解决后续的 MCoT 训练范式设计问题,我们开发了多任务联合训练方案,使模型在解耦 manner 下具备完成每个 MCoT 步骤所需的全部能力。该范式避免了收集一致多步骤数据元组的困难。大量实验表明,FoX 在各种 T2I 基准测试上均优于现有统一模型,显著提升了复杂图像生成性能。

关键词

引用

@article{arxiv.2503.01298,
  title  = {Towards Enhanced Image Generation Via Multi-modal Chain of Thought in Unified Generative Models},
  author = {Yi Wang and Mushui Liu and Wanggui He and Hanyang Yuan and Longxiang Zhang and Ziwei Huang and Guanghao Zhang and Wenkai Fang and Haoze Jiang and Shengxuming Zhang and Dong She and Jinlong Liu and Weilong Dai and Mingli Song and Hao Jiang and Jie Song},
  journal= {arXiv preprint arXiv:2503.01298},
  year   = {2025}
}