中文

MASPO:统一梯度利用、概率质量与信号可靠性以实现稳健高效的 LLM 推理

机器学习 2026-04-21 v3 人工智能

摘要

现有的强化学习可验证奖励(RLVR)算法,如GRPO,依赖刚性、统一且对称的信任区域机制,与大型语言模型(LLM)的复杂优化动力学根本不一致。本文我们识别出这些方法的三个关键挑战:(1)由于硬截断导致梯度利用效率低下;(2)统一比率约束导致概率质量不敏感,忽略了标记分布;(3)由于正负样本之间的信用分配歧义不对称,导致信号可靠性不对称。为弥合这些差距,我们提出Mass-Adaptive Soft Policy Optimization(MASPO),一个统一的框架旨在协调这三个维度。MASPO集成了可微分软高斯门控以最大化梯度效用,一个质量自适应限制器以在概率谱上平衡探索,以及一个非对称风险控制器以将更新幅度与信号置信度对齐。广泛的评估表明,MASPO作为一种稳健、全方位的RLVR解决方案,显著优于基线方法。我们的代码已公开:https://github.com/FlyTune/MASPO-RL。

关键词

引用

@article{arxiv.2602.17550,
  title  = {MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning},
  author = {Xiaoliang Fu and Jiaye Lin and Yangyi Fang and Binbin Zheng and Chaowen Hu and Zekai Shao and Cong Qin and Lu Pan and Ke Zeng and Xunliang Cai},
  journal= {arXiv preprint arXiv:2602.17550},
  year   = {2026}
}