中文

GoT-R1:利用强化学习释放 MLLM 在视觉生成中的推理能力

计算机视觉与模式识别 2026-04-14 v2 人工智能 计算与语言 机器学习 多媒体

摘要

视觉生成模型在创建逼真图像方面取得了显著进展,但在处理指定多个物体且空间关系与属性精确的复杂提示时仍感困难。有效处理此类提示需要对语义内容和空间布局进行显式推理。我们提出 GoT-R1,一种应用强化学习以提升语义-空间推理能力的框架。基于生成链条思维 (Generation Chain-of-Thought) 方法,GoT-R1 使模型能够通过精心设计的强化学习,自主发现超越预定义模板的有效推理策略。为实现此目标,我们提出了双阶段多维奖励框架,利用 MLLMs 评估推理过程与最终输出,实现整个生成管道的有效监督。奖励系统统一评估语义对齐、空间精确性和视觉质量。实验结果在 T2I-CompBench 上取得显著提升,尤其在涉及精确空间关系和属性绑定的组合任务上。GoT-R1 推动了图像生成领域的最新进展,成功将高级推理能力迁移至视觉生成领域。为促进未来研究,我们已公开代码和预训练模型:https://github.com/gogoduan/GoT-R1

关键词

引用

@article{arxiv.2505.17022,
  title  = {GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning},
  author = {Chengqi Duan and Rongyao Fang and Yuqing Wang and Kun Wang and Linjiang Huang and Xingyu Zeng and Hongsheng Li and Xihui Liu},
  journal= {arXiv preprint arXiv:2505.17022},
  year   = {2026}
}

备注

Github page refer to: https://github.com/gogoduan/GoT-R1. Published as a conference paper at ICLR 2026