ReasonGen-R1:通过 SFT 和 RL 实现自回归图像生成模型的思维链
计算机视觉与模式识别
2025-06-06 v2 计算与语言
摘要
尽管思维链推理和强化学习 (RL) 推动了自然语言处理 (NLP) 的突破,但它们在生成式视觉模型中的整合仍未得到充分探索。我们引入了 ReasonGen-R1,这是一个两阶段框架,首先通过在新生成的书面推理依据数据集上进行监督微调,赋予自回归图像生成器基于文本的显式“思考”技能,然后使用 Group Relative Policy Optimization 优化其输出。为了使模型能够在生成图像之前通过文本进行推理,我们自动生成并发布了一个由模型生成的推理依据语料库,并与视觉提示配对,从而实现对物体布局、风格和场景构成的受控规划。我们的 GRPO 算法使用来自预训练视觉语言模型的奖励信号来评估整体视觉质量,在每次更新中优化策略。在 GenEval、DPG 和 T2I 基准上的评估表明,ReasonGen-R1 始终优于强大的基线和先前的最先进模型。更多内容:aka.ms/reasongen。
引用
@article{arxiv.2505.24875,
title = {ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL},
author = {Yu Zhang and Yunqi Li and Yifan Yang and Rui Wang and Yuqing Yang and Dai Qi and Jianmin Bao and Dongdong Chen and Chong Luo and Lili Qiu},
journal= {arXiv preprint arXiv:2505.24875},
year = {2025}
}