中文

Multi-GRPO:基于树状轨迹和多奖励的文本到图像生成多组优势估计

计算机视觉与模式识别 2025-12-02 v1

摘要

最近,基于组相对策略优化 (GRPO) 的方法在文本到图像 (T2I) 模型对齐方面显示出巨大的潜力,但现有的GRPO方法存在两个关键局限性。(1) 共享信任分配:来自组归一化稀疏终端奖励的轨迹级优势在时间步上均匀应用,无法准确估计大规模探索空间中早期去噪步骤的潜在价值。(2) 奖励混合:针对组合多目标奖励(例如文本准确性、视觉质量、文本颜色)的预定义权重——这些奖励具有不匹配的尺度和方差——导致梯度不稳定和冲突更新。为此,我们提出了 Multi-GRPO,一种具有两个正交分组机制的多组优势估计框架。为更好的信任分配,我们引入受蒙特卡洛树搜索启发的树状轨迹:在选定的早期去噪步骤处分支的轨迹自然形成“时间组”,通过后代叶子实现对早期步骤的准确优势估计,同时通过共享前缀实现计算摊销。为多目标优化,我们引入基于奖励的分组机制,对每个奖励函数独立计算优势,再进行聚合,从而解耦冲突信号。为促进多个目标对齐的评估,我们精选了 OCR-Color-10 数据集,包含明确的颜色约束的视觉文本渲染。 在针对单奖励的 PickScore-25k 和多目标的 OCR-Color-10 基准测试中,Multi-GRPO 在稳定性和对齐性能方面均优于现有方法,有效平衡了冲突目标。代码将在 https://github.com/fikry102/Multi-GRPO 上公开。

关键词

引用

@article{arxiv.2512.00743,
  title  = {Multi-GRPO: Multi-Group Advantage Estimation for Text-to-Image Generation with Tree-Based Trajectories and Multiple Rewards},
  author = {Qiang Lyu and Zicong Chen and Chongxiao Wang and Haolin Shi and Shibo Gao and Ran Piao and Youwei Zeng and Jianlou Si and Fei Ding and Jing Li and Chun Pong Lau and Weiqiang Wang},
  journal= {arXiv preprint arXiv:2512.00743},
  year   = {2025}
}

备注

20 pages, 15 figures