中文

GEAR:通过自蒸馏实现大语言模型智能体的粒度自适应优势重加权

机器学习 2026-05-15 v2 人工智能 计算与语言

摘要

强化学习已成为大语言模型智能体广泛使用的后训练方法,其训练通常依赖于仅提供粗粒度监督的结果级奖励。虽然更细粒度的信用分配有望实现有效的策略更新,但获取可靠的局部信用并将其分配到长周期轨迹的正确部分仍然是一个开放挑战。本文提出粒度自适应优势重加权(GEAR),这是一种自适应粒度的信用分配框架,利用从自蒸馏中获得的词元级和片段级信号重塑轨迹级GRPO优势。GEAR将同策略学生模型与基于真实条件教师模型进行比较,获得参考引导的差异信号,用于识别自适应片段边界并调制局部优势权重。这种差异通常在语义偏离开始时出现峰值,而同一自回归延续中的后续词元可能恢复到低差异。因此,GEAR将此类峰值作为自适应信用区域的锚点:在学生模型与教师模型保持一致的地方,保留词元级分辨率;在出现偏离的地方,GEAR将相应的延续部分分组为一个自适应片段,并使用偏离点处的差异来调制该片段的优势。在八个数学推理和智能体工具使用基准上,使用Qwen3 4B和8B模型进行的实验表明,GEAR始终优于标准GRPO、仅自蒸馏基线以及词元级或轮次级信用分配方法。在GRPO基线准确率较低的基准上,增益尤为显著,最高可比GRPO提高约20%,这表明所提出的自适应重加权方案在更具挑战性的长周期场景中特别有用。

关键词

引用

@article{arxiv.2605.11853,
  title  = {GEAR: Granularity-Adaptive Advantage Reweighting for LLM Agents via Self-Distillation},
  author = {Sijia Li and Yuchen Huang and Zifan Liu and Yanping Li and Jingjing Fu and Li Zhao and Jiang Bian and Ling Zhang and Jun Zhang and Rui Wang},
  journal= {arXiv preprint arXiv:2605.11853},
  year   = {2026}
}