中文

在 LLM-智能体时代重访 DAgger

机器学习 2026-05-14 v1

摘要

长期轨迹 LM 智能体从多轮交互中学习,单个早期错误会改变后续状态分布并导致整个轨迹偏离。现有的配方在不同方面都不够完整:监督微调提供密集的教师监督,但 suffer 从因在离策略教师轨迹上训练而导致的协变量漂移;而利用可验证奖励的强化学习通过学习 on-policy rollout 避免了这种离策略不匹配,但仅提供稀疏的结果反馈。我们通过重新审视 Dataset Aggregation (DAgger) 来解决这一困境,用于多轮 LM 智能体:该算法通过学生和教师策略的轮级插值收集轨迹,然后使用教师提供的监督标签对这些轨迹进行训练。通过直接与环境交互,我们将模型暴露于部署期间可能遇到的真实状态,从而有效地缓解协变量漂移。此外,由于学生通过模仿教师行为学习,因此在学习过程中接收到丰富的反馈。为了展示 DAgger 享有两端的优势,我们测试了该算法来训练一个 4B 和 8B 规模的学生模型。在 SWE-bench Verified 上,我们的 DAgger 风格训练在 4B 和 8B 上分别超过最强的 post-training baseline 提高了 3.9 分和 3.6 分。结果的 4B 智能体达到 27.3%,超越代表性的 8B SWE-智能体系统,而 8B 智能体实现 29.8%,超过 SWE-Gym-32B 并距离更强的 32B 规模智能体仅差 5 分。除了在保持的 SWE-Gym 分割上持续获得收益,这些结果表明 DAgger 对现代的长期轨迹 LM 智能体有效。

关键词

引用

@article{arxiv.2605.12913,
  title  = {Revisiting DAgger in the Era of LLM-Agents},
  author = {Changhao Li and Rushi Qiang and Jiawei Huang and Chenxiao Gao and Chao Zhang and Niao He and Bo Dai},
  journal= {arXiv preprint arXiv:2605.12913},
  year   = {2026}
}