解决动作瓶颈:基于 Token 级能量的智能体强化学习
机器学习
2026-05-15 v1 人工智能
计算与语言
摘要
智能体强化学习使用多轮轨迹训练大语言模型,这些轨迹将长推理链与面向环境的短动作交织在一起。常见的策略梯度方法(如 PPO 和 GRPO)对轨迹中的每个 token 同等对待,导致均匀的信用分配。在本文中,我们批判性地证明了这种均匀的信用分配在很大程度上错误分配了 token 级训练信号。从基于能量的建模视角出发,我们表明 token 级训练信号(由其与从给定提示采样的不同展开的奖励方差之间的相关性量化)急剧集中在动作 token 而非推理 token 上,尽管动作 token 仅占轨迹的一小部分。我们将这一现象称为动作瓶颈。受此观察启发,我们提出了一种极其简单的 token 重加权方法 ActFocus,该方法降低了对推理 token 的梯度权重,并引入了额外的基于能量的重分配机制,进一步提高了具有较高不确定性的动作 token 的权重。在四个环境和不同模型规模下,ActFocus 始终优于 PPO 和 GRPO,最终步增益分别高达 65.2 和 63.7 个百分点,且无需任何额外的运行时或内存成本。
引用
@article{arxiv.2605.14558,
title = {Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy},
author = {Langzhou He and Junyou Zhu and Yue Zhou and Zhengyao Gu and Junhua Liu and Wei-Chieh Huang and Henry Peng Zou and David Wipf and Philip S. Yu and Qitian Wu},
journal= {arXiv preprint arXiv:2605.14558},
year = {2026}
}
备注
Preprint