基于 LLM 的查询扩展自动构建领域内示例及多 LLM 扩展的精炼
信息检索
2026-03-16 v2 人工智能
摘要
使用大语言模型进行查询扩展具有前景,但往往依赖手工设计的提示、手动挑选的示例或单一 LLM,导致不可扩展且对领域迁移敏感。我们提出了一个自动、领域适应的查询扩展框架,通过收集伪相关 passages 构建领域内示例池。采用无监督的聚类策略选择多样化的演示,实现无需监督的强大且稳定的上下文学习查询扩展。为进一步利用模型互补性,我们引入两种 LLM 集成,其中两种异构 LLM 独立生成扩展,再由一个精炼 LLM 将其整合为一个连贯的扩展。跨 TREC DL20、DBPedia 和 SciFact,精炼集成 consistently and statistically significant 地超越 BM25、Rocchio、零样本和固定少数样本基线。该框架提供了一个可复现的测试平台,用于示例选择和多 LLM 生成,也为实际应用提供了一个无标签的查询扩展解决方案。
引用
@article{arxiv.2602.08917,
title = {Automatic In-Domain Exemplar Construction and LLM-Based Refinement of Multi-LLM Expansions for Query Expansion},
author = {Minghan Li and Ercong Nie and Siqi Zhao and Tongna Chen and Huiping Huang and Guodong Zhou},
journal= {arXiv preprint arXiv:2602.08917},
year = {2026}
}
备注
Preprint. This paper is under consideration at Pattern Recognition Letters