中文

LongAct: 利用内在激活模式进行长上下文强化学习

机器学习 2026-04-17 v1 计算与语言

摘要

强化学习(RL)已成为增强大型语言模型(LLM)推理能力的关键驱动力。虽然最近的进展集中在奖励工程或数据合成上,但很少有研究利用模型的内在表示特征来指导训练过程。在本文中,我们首先观察到在处理长上下文时,查询和键向量内存在高幅度激活。受模型量化(它确立了此类高幅度激活的关键性)以及长上下文推理本质上具有稀疏结构这一见解的启发,我们假设这些权重是有效模型优化的关键驱动力。基于这一见解,我们提出了LongAct,一种从均匀更新转向显著性引导的稀疏更新的策略。通过仅选择性地更新与这些显著激活相关的权重,LongAct在LongBench v2上实现了约8%的提升,并增强了在RULER基准上的泛化能力。此外,我们的方法表现出显著的通用性,能够持续提升不同RL算法(如GRPO和DAPO)的性能。大量的消融研究表明,关注这些显著特征是释放长上下文潜力的关键。

关键词

引用

@article{arxiv.2604.14922,
  title  = {LongAct: Harnessing Intrinsic Activation Patterns for Long-Context Reinforcement Learning},
  author = {Bowen Ping and Zijun Chen and Tingfeng Hui and Qize Yu and Chenxuan Li and Junchi Yan and Baobao Chang},
  journal= {arXiv preprint arXiv:2604.14922},
  year   = {2026}
}