中文

AlphaGRPO:通过分解可验证奖励解锁 UMMs 中自反式多模态生成

计算机视觉与模式识别 2026-05-13 v1 人工智能 机器学习

摘要

本文提出 AlphaGRPO,一种将群相对政策优化 (GRPO) 应用于统一多模态模型 (UMM) 的新框架,以提升多模态生成能力,无需额外的冷启动阶段。我们的方法释放了模型内在的潜能,以执行高级推理任务:文本到图像生成推理,其中模型主动推断隐含用户意图;以及自反式精炼,其中其自主诊断和纠正生成输出中的不一致。为解决为实际多模态生成提供稳定监督的挑战,我们引入分解可验证奖励 (DVReward)。不同于整体标量奖励,DVReward 使用 LLM 将复杂用户请求分解为原子、可验证的语义和质量问题,再由通用 MLLM 进行评估,提供可靠且可解释的反馈。广泛的实验表明,AlphaGRPO 在多模态生成基准中实现了稳健的改进,包括 GenEval、TIIF-Bench、DPG-Bench 和 WISE,同时在 GEdit 上的编辑任务中取得显著提升,无需在编辑任务上进行训练。这些结果表明,我们的自反式强化方法有效地利用内在理解能力指导高保真生成。项目页面:https://huangrh99.github.io/AlphaGRPO/。

关键词

引用

@article{arxiv.2605.12495,
  title  = {AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward},
  author = {Runhui Huang and Jie Wu and Rui Yang and Zhe Liu and Hengshuang Zhao},
  journal= {arXiv preprint arXiv:2605.12495},
  year   = {2026}
}

备注

ICML2026