从纠错到精通:大型语言模型智能体的强化蒸馏
计算与语言
2025-10-10 v2 人工智能
摘要
大语言模型智能体通过迭代推理和工具使用在解决复杂任务方面表现出色,但通常依赖超大型且昂贵的骨干模型。现有的蒸馏方法训练较小的学生模型来模仿完整的教师轨迹,但教师与学生之间的推理和知识差距可能导致错误累积。我们提出了 SCoRe,一个以学生为中心的框架,学生生成训练轨迹,教师仅纠正最早的错误,产生与学生能力匹配的训练数据并暴露特定弱点。学生首先在修正后的轨迹上进行微调。随后,从验证前缀(即最早错误之前的部分)开始短视界强化学习,在该步骤分配目标奖励。这种设计鼓励超越模仿的自主问题解决并增强训练稳定性。在 12 个具有挑战性的基准上,一个 7B 参数的学生模型通过 SCoRe 蒸馏后达到了 72B 参数教师的智能体性能。
引用
@article{arxiv.2509.14257,
title = {From Correction to Mastery: Reinforced Distillation of Large Language Model Agents},
author = {Yuanjie Lyu and Chengyu Wang and Jun Huang and Tong Xu},
journal= {arXiv preprint arXiv:2509.14257},
year = {2025}
}