TROLL:信任区域改进大语言模型的强化学习
机器学习
2026-02-24 v3 机器学习
摘要
基于 PPO 式裁剪目标的强化学习 (RL) 已成为大语言模型 (LLM) 基于奖励的微调标准选择。尽管最近的工作探索了优势估计器和归一化的改进方法,但裁剪机制本身保持未被触动。最初引入的作为原则性 KL 基于信任区域的代理,裁剪是一种粗糙的近似,常导致不稳定的更新和次优性能。我们用 novel discrete differentiable trust region projection 替代裁剪目标,该投影提供原则性的 token 级别 KL 约束。投影作用于模型最重要的 token logits 的稀疏子集,以平衡计算成本和投影有效性。我们的方法,Trust Region Optimization for Large Language models (TROLL),可直接替换 PPO 式裁剪用于训练,不会改变模型的推理行为。在数学推理和代码生成任务中,TROLL 在训练速度、稳定性和最终成功率方面均 consistently 优于 PPO 式裁剪。
引用
@article{arxiv.2510.03817,
title = {TROLL: Trust Regions improve Reinforcement Learning for Large Language Models},
author = {Philipp Becker and Niklas Freymuth and Serge Thilges and Fabian Otto and Gerhard Neumann},
journal= {arXiv preprint arXiv:2510.03817},
year = {2026}
}
备注
Published as a conference paper at ICLR 2026