中文

MoR:更有效地处理多样化查询的稀疏、密集与人类检索器混合方法

信息检索 2025-06-23 v1 人工智能 计算与语言

摘要

检索增强生成(RAG)虽然强大,但其有效性取决于所使用的检索器及其方式。不同的检索器提供独特且常常互补的信号:BM25捕获词汇匹配;密集检索器捕获语义相似性。然而实际中,我们通常基于启发式方法固定单一检索器,这会导致其在不同信息需求下难以泛化。我们能否为每个 individual query 动态选择并集成多个检索器,而无需手动选择?本文通过定量分析验证了这一直觉,并引入检索器混合:一种零样本、加权的异构检索器组合。大量实验表明,这种混合方法有效且高效:尽管仅需0.8B参数,该混合模型在各个检索器和更大规模的7B模型中分别平均提升了+10.8%和+3.9%。进一步分析显示,这一混合框架还能将 specialized non-oracle human 信息源作为检索器纳入,实现良好协作,相较于仅模拟的人类提升了58.9%。

关键词

引用

@article{arxiv.2506.15862,
  title  = {MoR: Better Handling Diverse Queries with a Mixture of Sparse, Dense, and Human Retrievers},
  author = {Jushaan Singh Kalra and Xinran Zhao and To Eun Kim and Fengyu Cai and Fernando Diaz and Tongshuang Wu},
  journal= {arXiv preprint arXiv:2506.15862},
  year   = {2025}
}

备注

19 pages, 3 figures