面向长程 LLM 强化学习的信任域掩码
机器学习
2026-03-02 v4 人工智能
信息论
math.IT
机器学习
摘要
策略梯度方法用于大语言模型(LLM)通过从 rollout 策略 的样本计算的代理目标来优化策略 。然而,现代 LLM-RL 流水线因后端差异、Mixture-of-Experts 路由断裂以及分布式训练延迟等不可避免的实现偏差,导致离策略不匹配()以及代理目标与真实目标之间的近似误差。我们表明,经典信任域对该误差的界限随序列长度 呈 增长,使其在长程任务中失去意义。为此,我们推导了一族界限——包括基于 KL 散度和总变距离(TV)的界限,以及通过 per-position importance-ratio 分解得到的 Pinsker-Marginal 界限()、Mixed 界限()以及严格推广 Pinsker-Marginal 界限的 Adaptive 界限。取所有界限的最小值可获得在所有发散 regime 下最紧的保证。关键在于,所有界限都依赖于最大 token 级散度 (或 ),这是一序列级量量,无法通过仅与 token 独立的方法(如 PPO 裁剪)加以控制。我们提出信任域掩码(TRM),对违反信任域的完整序列进行掩码处理,使其能够为长程 LLM-RL 首次提供非空洞的单调改进保证。
引用
@article{arxiv.2512.23075,
title = {Trust Region Masking for Long-Horizon LLM Reinforcement Learning},
author = {Yingru Li and Jiacai Liu and Jiawei Xu and Yuxuan Tong and Ziniu Li and Qian Liu and Baoxiang Wang},
journal= {arXiv preprint arXiv:2512.23075},
year = {2026}
}