中文

DeepRetrieval: 通过强化学习利用大语言模型破解真实搜索引擎与检索器

信息检索 2025-04-15 v3

摘要

信息检索系统对于有效访问大型文档集合至关重要。近期方法利用大语言模型(LLMs)通过查询增强来提升检索性能,但通常依赖昂贵的监督学习或蒸馏技术,需要大量计算资源和人工标注数据。我们提出 DeepRetrieval,一种强化学习(RL)方法,通过试错训练 LLM 进行查询生成,无需监督数据(参考查询)。以检索指标作为奖励,我们的系统生成最大化检索性能的查询。DeepRetrieval 在文献检索上以 65.07%(前 SOTA 24.68%)的召回率超越领先方法,在试验检索上以 63.18%(前 SOTA 32.11%)的召回率超越领先方法,使用真实搜索引擎。在证据检索、经典信息检索和 SQL 数据库检索方面也表现卓越。仅 3B 参数,在 13 个数据集中的 11 个上超越了 GPT-4o 和 Claude-3.5-Sonnet 等行业领先模型。这些结果表明我们的 RL 方法为信息检索提供了一种更高效、更有效的范式。数据和代码可在 https://github.com/pat-jj/DeepRetrieval 获取。

关键词

引用

@article{arxiv.2503.00223,
  title  = {DeepRetrieval: Hacking Real Search Engines and Retrievers with Large Language Models via Reinforcement Learning},
  author = {Pengcheng Jiang and Jiacheng Lin and Lang Cao and Runchu Tian and SeongKu Kang and Zifeng Wang and Jimeng Sun and Jiawei Han},
  journal= {arXiv preprint arXiv:2503.00223},
  year   = {2025}
}