AMIR-GRPO:将隐式偏好信号引入GRPO
机器学习
2026-01-08 v1 人工智能
摘要
强化学习已成为在复杂推理任务上对齐大型语言模型(LLM)的主要范式,其中群体相对策略优化(GRPO)被广泛用于大规模后训练。然而,GRPO在推理密集型场景中面临结构性限制:序列级优势归一化引入了系统性长度偏差,对低质量轨迹的惩罚被稀释,并且标量目标函数丢弃了嵌入在组内奖励排序中的丰富成对偏好信息。因此,来自昂贵推演的有价值监督信号仍未得到充分利用。我们提出AMIR-GRPO,它通过一个直接从组内奖励排序构建的隐式DPO风格对比正则化器来增强GRPO,无需额外标注。该机制放大了对低奖励轨迹的抑制,减弱了响应级长度偏差,并将每个推演组转化为一组更密集的监督约束。在多个数学推理基准上,AMIR-GRPO始终优于强大的GRPO基线,在正确与错误推理链之间产生了更清晰的分离,并在标准GRPO所解决实例的子集之外提供了更广泛的覆盖增益。
引用
@article{arxiv.2601.03661,
title = {AMIR-GRPO: Inducing Implicit Preference Signals into GRPO},
author = {Amir Hossein Yari and Fajri Koto},
journal= {arXiv preprint arXiv:2601.03661},
year = {2026}
}