中文

面向长程 LLM 强化学习的信任域掩码

机器学习 2026-03-02 v4 人工智能 信息论 math.IT 机器学习

摘要

策略梯度方法用于大语言模型(LLM)通过从 rollout 策略 πroll\pi_{\text{roll}} 的样本计算的代理目标来优化策略 πθ\pi_\theta。然而,现代 LLM-RL 流水线因后端差异、Mixture-of-Experts 路由断裂以及分布式训练延迟等不可避免的实现偏差,导致离策略不匹配(πrollπθ\pi_{\text{roll}} \neq \pi_\theta)以及代理目标与真实目标之间的近似误差。我们表明,经典信任域对该误差的界限随序列长度 TTO(T2)O(T^2) 增长,使其在长程任务中失去意义。为此,我们推导了一族界限——包括基于 KL 散度和总变距离(TV)的界限,以及通过 per-position importance-ratio 分解得到的 Pinsker-Marginal 界限(O(T3/2)O(T^{3/2}))、Mixed 界限(O(T)O(T))以及严格推广 Pinsker-Marginal 界限的 Adaptive 界限。取所有界限的最小值可获得在所有发散 regime 下最紧的保证。关键在于,所有界限都依赖于最大 token 级散度 DKLtok,maxD_{\mathrm{KL}}^{\mathrm{tok,max}}(或 DTVtok,maxD_{\mathrm{TV}}^{\mathrm{tok,max}}),这是一序列级量量,无法通过仅与 token 独立的方法(如 PPO 裁剪)加以控制。我们提出信任域掩码(TRM),对违反信任域的完整序列进行掩码处理,使其能够为长程 LLM-RL 首次提供非空洞的单调改进保证。

关键词

引用

@article{arxiv.2512.23075,
  title  = {Trust Region Masking for Long-Horizon LLM Reinforcement Learning},
  author = {Yingru Li and Jiacai Liu and Jiawei Xu and Yuxuan Tong and Ziniu Li and Qian Liu and Baoxiang Wang},
  journal= {arXiv preprint arXiv:2512.23075},
  year   = {2026}
}