SEED-GRPO:基于语义熵增强的 GRPO 以不确定性为导向的策略优化
人工智能
2025-05-20 v1
摘要
大型语言模型(LLM)在输入提示(问题)上的置信水平存在差异:一些导致一致且语义相似的答案,而另一些则产生多样或矛盾的输出。这种差异反映了 LLM 对输入提示的不确定性,即其对给定问题理解程度的信心。然而,原始的群体相对策略优化(GRPO)在策略更新时 treats all prompts equally,忽略了关于模型知识边界的重要信息。为此,我们提出 SEED-GRPO(Semantic Entropy EnhanceD GRPO),显式测量 LLM 输入提示的语义熵。语义熵衡量给定提示生成多个答案之间意义多样性,并用于调制策略更新的幅度。这种不确定性感知的训练机制使策略更新幅度能够基于问题不确定性进行动态调整。在高不确定性问题上进行更保守的更新,而在自信的问题上保持原始学习信号。在五个数学推理基准测试(AIME24 56.7、AMC 68.7、MATH 83.4、Minerva 34.2、OlympiadBench 48.0)上的实验结果表明,SEED-GRPO 在平均准确率上实现了新的最佳性能,验证了不确定性感知策略优化的有效性。
引用
@article{arxiv.2505.12346,
title = {SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization},
author = {Minghan Chen and Guikun Chen and Wenguan Wang and Yi Yang},
journal= {arXiv preprint arXiv:2505.12346},
year = {2025}
}
备注
On going project