强化学习遇见掩码生成模型:用于文本到图像生成的 Mask-GRPO
计算机视觉与模式识别
2026-02-03 v2
摘要
强化学习(RL)在文本到图像(T2I)生成中受到日益关注,但大多数现有 RL 方法要么针对扩散模型,要么针对自回归模型,忽视了重要的另一种选择:掩码生成模型。本文提出了 Mask-GRPO,将基于组相对政策优化(GRPO)的 RL 方法引入该被忽视的范畴。我们的核心洞察是重新定义转移概率,这与当前方法不同,并将解掩码过程形式化为多步骤决策问题。为进一步提升该方法,我们探索了若干有用策略,包括移除 KL 约束、应用归约策略以及过滤低质量样本。使用 Mask-GRPO,我们对基础模型 Show-o 进行了显著改进,在标准 T2I 基准测试和偏好对齐方面均超越了现有最先进的方法。代码已公开于 https://github.com/xingzhejun/Mask-GRPO
引用
@article{arxiv.2510.13418,
title = {Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation},
author = {Yifu Luo and Xinhao Hu and Keyu Fan and Haoyuan Sun and Zeyu Chen and Bo Xia and Tiantian Zhang and Yongzhe Chang and Xueqian Wang},
journal= {arXiv preprint arXiv:2510.13418},
year = {2026}
}