不要让低概率标记在 LLM 的强化学习中过度主导
计算与语言
2025-05-20 v1 人工智能
机器学习
摘要
强化学习 (RL) 已成为增强大型语言模型 (LLM) 推理能力的核心方法,近期诸如「Group Relative Policy Optimization (GRPO)」等创新技术展现出卓越的有效性。本研究识别到 RL 训练中存在一个关键且尚未充分探讨的问题:低概率标记因其较大的梯度幅度而对模型更新产生过大影响。这种影响力的主导地位阻碍了高概率标记的有效学习,而高概率标记的梯度对 LLM 的性能至关重要,但其贡献却被显著压制。为缓解这种干扰,我们提出两种新颖方法:优势重加权 (Advantage Reweighting) 和低概率标记隔离法 (Low-Probability Token Isolation, Lopti),这两种方法均能有效削弱低概率标记的梯度,同时强调由高概率标记驱动的参数更新。我们的做法促进了不同概率范围内标记之间更新的平衡,从而提高了 RL 训练的效率。实验结果表明,我们的方法显著提升了基于 GRPO 训练的 LLM 性能,在 K&K 逻辑谜题推理任务中实现了最高可达 46.2% 的提升。我们的实现已公开于 https://github.com/zhyang2226/AR-Lopti。
引用
@article{arxiv.2505.12929,
title = {Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs},
author = {Zhihe Yang and Xufang Luo and Zilong Wang and Dongqi Han and Zhiyuan He and Dongsheng Li and Yunjian Xu},
journal= {arXiv preprint arXiv:2505.12929},
year = {2025}
}
备注
24 pages, 12 figures