蒸馏什么与何时蒸馏:面向多轮智能体的选择性后见蒸馏
人工智能
2026-05-20 v1
摘要
强化学习可以从稀疏的任务奖励中训练大语言模型智能体,但长程信用分配仍然具有挑战性:单个成功或失败信号必须分配到众多动作上。现有方法依赖于轨迹级别的奖励或代理信号,未能充分利用每步的环境反馈。多轮智能体设置尚未得到充分探索,在该设置中,反馈可以包括错误消息、页面变化、观察结果或参考轨迹。我们系统地研究了五种反馈来源和两种插入粒度,并引入了SERL,一种选择性环境加权学习框架。SERL使用任务奖励来确定更新方向,而环境反馈则调整放置位置和幅度,聚焦于关键动作。在ALFWorld和WebShop上,SERL分别达到了90.0%和80.1%的成功率,优于强强化学习和蒸馏基线。分析表明,在关键点处使用基于具体动作的、与动作相关的反馈,其效果始终优于不加区分地使用更长或更丰富的上下文。
引用
@article{arxiv.2605.19447,
title = {What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents},
author = {Xiaozhe Li and Tianyi Lyu and Yang Li and Yichuan Ma and Peiji Li and Linyang Li and Qipeng Guo and Dahua Lin and Kai Chen},
journal= {arXiv preprint arXiv:2605.19447},
year = {2026}
}