利用强化学习驱动的基于语言模型的信息检索器:通过查询-文档共数据增强
信息检索
2025-06-24 v1
摘要
最近的研究提出利用大语言模型(LLM)作为信息检索器,通过查询改写实现检索。然而,对于具有挑战性的语料库,我们认为仅增强查询不足以实现稳健的语义匹配;LLM还需通过直接处理和增强文档本身来充分理解语料库。为此,我们提出了一种能够同时增强用户查询和语料库文档的LLM-based检索器,其策略通过强化学习(RL)完全探索,并尽可能减少人类归纳偏差。值得注意的是,我们发现仅允许LLM修改文档几乎没有收益,除非配合我们精心设计的双向RL框架,该框架使LLM能够同时学习和协作地处理查询和文档增强策略。实现此框架的关键技术挑战在于在训练期间联合更新两个策略,其中两个方向的奖励相互依赖,导致其缠绕的奖励难以处理。我们的ethods通过引入奖励抽样策略和专为处理这些抽样奖励而设计的特定RL算法,实现了有效的训练。实验结果表明,我们的方法在稀疏和稠密设置下均显著提升了LLM-based检索性能,尤其在困难检索领域表现突出,并实现了强大的跨基准泛化。我们的代码已发布于https://github.com/liujm2001/CoAugRetriever。
关键词
引用
@article{arxiv.2506.18670,
title = {Harnessing the Power of Reinforcement Learning for Language-Model-Based Information Retriever via Query-Document Co-Augmentation},
author = {Jingming Liu and Yumeng Li and Wei Shi and Yao-Xiang Ding and Hui Su and Kun Zhou},
journal= {arXiv preprint arXiv:2506.18670},
year = {2025}
}