中文

通过 RAG 微调提升大语言模型学习新技能的能力

人工智能 2025-10-03 v1 计算与语言

摘要

大型语言模型 (LLM) 在执行多步骤任务时经常以可预测的方式失败:尝试执行前置条件未满足的动作、发布冗余命令,或处理环境约束时出错。虽然检索增强生成 (RAG) 通过提供运行时指导可以提升性能,但需要维护外部知识库,并在每次部署时增加计算开销。我们提出了一个简单管道,将推理时检索转化为通过蒸馏实现的学习能力。我们的 метод: (1) 从智能体失败中提取紧凑、可重用的提示; (2) 使用这些提示通过剧集开始时的单次检索生成改进的教师轨迹; (3) 在去除提示字符串后对学生模型进行训练,以迫使其内化而非记忆。 在两个交互式基准测试中,ALFWorld (家务任务) 和 WebShop (在线购物),蒸馏后的学生模型持续优于基线智能体,ALFWorld 上成功率达到 91% (基线为 79%),WebShop 分数提升至 72 (基线为 61),同时使用检索增强型教师的 10-60% 较少的 token。该方法在不同模型规模 (7B/14B 参数) 和智能体架构 (ReAct/StateAct) 下均具有普适性,表明通过有针对性的微调可有效内化检索收益,而无需永久性运行时依赖。

关键词

引用

@article{arxiv.2510.01375,
  title  = {Fine-tuning with RAG for Improving LLM Learning of New Skills},
  author = {Humaid Ibrahim and Nikolai Rozanov and Marek Rei},
  journal= {arXiv preprint arXiv:2510.01375},
  year   = {2025}
}

备注

Under review at ICLR 2026