中文

Co-GRPO:用于掩码扩散模型的联合优化组相对政策优化

机器学习 2025-12-30 v1 人工智能 计算机视觉与模式识别

摘要

最近,掩码扩散模型(Masked Diffusion Models,MDMs)在视觉、语言和跨模态生成方面显示出巨大的潜力。然而,其训练和推理程序之间存在显著差异。具体而言,MDM 推理是受制于多步骤、迭代过程,不仅由模型本身决定,也由各种 schedule 决定,这些 schedule 决定了 token 解码轨迹(例如,每一步解码多少个 token)。相比之下,MDMs 通常使用简化的单步骤 BERT 风格目标进行训练,该目标掩盖一部分 token 并同时预测所有 token。这种 step 级别的简化从根本上脱离了推理的轨迹层面,使得推理 schedule 在训练期间从未被优化。本文引入 Co-GRPO,通过将 MDM 生成 reformulation 为统一的马尔可夫决策过程(MDP),联合包含模型和推理 schedule。应用组相对政策优化(Group Relative Policy Optimization)于轨迹层面,Co-GRPO 在共享奖励下协同优化模型参数和 schedule 参数,而无需通过多步骤生成过程进行高成本反向传播。这一整体优化更彻底地将训练与推理对齐,显著提升生成质量。跨越四大基准——ImageReward、HPS、GenEval 和 DPG-Bench——的实证结果证明了本方法的有效性。欲了解更多细节,请参阅我们的项目页面:https://co-grpo.github.io/。

关键词

引用

@article{arxiv.2512.22288,
  title  = {Co-GRPO: Co-Optimized Group Relative Policy Optimization for Masked Diffusion Model},
  author = {Renping Zhou and Zanlin Ni and Tianyi Chen and Zeyu Liu and Yang Yue and Yulin Wang and Yuxuan Wang and Jingshu Liu and Gao Huang},
  journal= {arXiv preprint arXiv:2512.22288},
  year   = {2025}
}

备注

17 pages, 6 figures