中文

紧凑语言模型能否像智能体一样搜索?基于蒸馏引导的策略优化以保持智能体RAG能力

计算与语言 2026-04-28 v4

摘要

强化学习已成为激发语言模型智能体RAG行为(如搜索和规划)的主导后训练方法。尽管在大型模型上取得了成功,但将RL应用于紧凑模型(例如0.5--1B参数)仍面临独特挑战。紧凑模型表现不佳,导致奖励稀疏且训练不稳定。为克服这些困难,我们提出了蒸馏引导策略优化(DGPO),该方法采用来自教师演示的冷启动初始化,并在策略优化期间持续提供教师指导。为理解紧凑模型如何保持智能体行为,我们引入了智能体RAG能力(ARC)指标,对推理、搜索协调和响应合成进行细粒度分析。全面实验表明,DGPO使紧凑模型能够实现 sophisticated 智能体搜索行为,甚至在某些情况下超过更大的教师模型。DGPO使受计算资源限制的环境中的智能体RAG变得可行。

关键词

引用

@article{arxiv.2508.20324,
  title  = {Can Compact Language Models Search Like Agents? Distillation-Guided Policy Optimization for Preserving Agentic RAG Capabilities},
  author = {Rikuto Kotoge and Mai Nishimura and Jiaxin Ma},
  journal= {arXiv preprint arXiv:2508.20324},
  year   = {2026}
}

备注

Accepted at ACL 2026 Main