AdaSearch:通过强化学习在大语言模型中平衡参数化知识与搜索
计算与语言
2025-12-19 v1
摘要
通过强化学习(RL)为大语言模型(LLMs)配备搜索引擎已成为有效构建搜索代理的方法。然而,过度依赖搜索会引入不必要的成本并暴露于噪声或恶意内容的风险,而仅依赖参数化知识则可能导致幻觉。核心挑战在于开发能够自适应平衡参数化知识与外部搜索的智能体,仅在必要时调用搜索。先前的工作通过围绕工具调用次数进行奖励塑造来缓解搜索过度使用问题。然而,这些惩罚需要大量的奖励工程,信用分配模糊且可能被操纵的智能体通过表面化地减少调用次数来利用。此外,仅通过调用次数评估性能会混淆必要与不必要的搜索,掩盖了对真实自适应行为的测量。为克服这些限制,我们首先通过基于F1的决策指标量化现有搜索智能体的自我知识意识,揭示诸如Search-R1等方法常常忽视了 readily 可用的参数化知识。鼓舞人心之下,我们提出AdaSearch,一个简单的两阶段、以结果为导导的RL框架,将问题解决与是否调用搜索的决策分离,并使该决策过程显式且可解释。这一透明性对于金融和医疗问答等高风险领域至关重要,却被先前方法所忽视。跨多个模型家族和规模的实验表明,AdaSearch显著改善了知识边界意识,减少了不必要的搜索调用,保持了强大的任务性能,并提供了更透明、可解释的决策行为。
引用
@article{arxiv.2512.16883,
title = {AdaSearch: Balancing Parametric Knowledge and Search in Large Language Models via Reinforcement Learning},
author = {Tzu-Han Lin and Wei-Lin Chen and Chen-An Li and Hung-yi Lee and Yun-Nung Chen and Yu Meng},
journal= {arXiv preprint arXiv:2512.16883},
year = {2025}
}
备注
Preprint. Code and artifacts will be uploaded to https://github.com/hank0316/AdaSearch