中文

基于 LLM 的查询扩展自动构建领域内示例及多 LLM 扩展的精炼

信息检索 2026-03-16 v2 人工智能

摘要

使用大语言模型进行查询扩展具有前景,但往往依赖手工设计的提示、手动挑选的示例或单一 LLM,导致不可扩展且对领域迁移敏感。我们提出了一个自动、领域适应的查询扩展框架,通过收集伪相关 passages 构建领域内示例池。采用无监督的聚类策略选择多样化的演示,实现无需监督的强大且稳定的上下文学习查询扩展。为进一步利用模型互补性,我们引入两种 LLM 集成,其中两种异构 LLM 独立生成扩展,再由一个精炼 LLM 将其整合为一个连贯的扩展。跨 TREC DL20、DBPedia 和 SciFact,精炼集成 consistently and statistically significant 地超越 BM25、Rocchio、零样本和固定少数样本基线。该框架提供了一个可复现的测试平台,用于示例选择和多 LLM 生成,也为实际应用提供了一个无标签的查询扩展解决方案。

关键词

引用

@article{arxiv.2602.08917,
  title  = {Automatic In-Domain Exemplar Construction and LLM-Based Refinement of Multi-LLM Expansions for Query Expansion},
  author = {Minghan Li and Ercong Nie and Siqi Zhao and Tongna Chen and Huiping Huang and Guodong Zhou},
  journal= {arXiv preprint arXiv:2602.08917},
  year   = {2026}
}

备注

Preprint. This paper is under consideration at Pattern Recognition Letters