中文

M3:通过多模态、多智能体与多轮视觉推理实现高保真文本到图像生成

计算机视觉与模式识别 2026-02-09 v1

摘要

生成模型在文本到图像合成方面取得了显著的保真度,但在涉及多个约束的复杂构面提示上仍表现不足。我们提出了\textbf{M3(Multi-Modal, Multi-Agent, Multi-Round)},一种无需训练的框架,通过迭代推理时间细化系统性地解决这些问题。M3 在推理阶段组织运用现成基础模型,构建一个稳健的多智能体循环:Planner 将提示分解为可验证的检查清单,而专职 Checker、Refiner 与 Editor 智能体则逐一对约束进行精准纠正,Verifier 确保单调性提升。该方法被应用于开源模型后,在具有挑战性的 OneIG-EN 数据集上取得了惊人的成绩,搭配 Qwen-Image+M3 的模型相较于 Imagen4(0.515)与 Seedream 3.0(0.530)等商业旗舰系统,达到了最佳水平(0.532)。这表明智能多智能体推理能够将开源模型提升至专有方案之上。M3 亦显著提升了 GenEval 构面指标,在硬化测试集上实现了空间推理性能的约倍提升。作为与任意预训练 T2I 模型兼容的即插即用模块,M3 确立了无需高成本再训练即可实现构面生成的新范式。

关键词

引用

@article{arxiv.2602.06166,
  title  = {M3: High-fidelity Text-to-Image Generation via Multi-Modal, Multi-Agent and Multi-Round Visual Reasoning},
  author = {Bangji Yang and Ruihan Guo and Jiajun Fan and Chaoran Cheng and Ge Liu},
  journal= {arXiv preprint arXiv:2602.06166},
  year   = {2026}
}