中文

众多查询之智慧:稠密检索训练的复杂度-多样性原理

信息检索 2026-03-17 v4 机器学习

摘要

合成查询生成已成为训练稠密检索器的必不可少的手段,但先前方法仅为每个文档生成一个查询,仅关注查询质量。我们首次系统性地研究了多查询合成,发现质量与多样性之间存在权衡:高质量查询在近义任务中受益,而多样化查询在跨域(OOD)泛化方面受益。通过在Contriever、RetroMAE和Qwen3-Embedding上进行4种基准类型的受控实验,我们发现多样性收益与查询复杂度高度相关(r≥0.95,p<0.05),以内容词(CW)近似表示。我们将此形式化为复杂度-多样性原理(CDP):查询复杂度决定最优多样性。基于CDP,我们提出复杂度感知训练:针对高复杂度任务进行多查询合成,针对现有数据进行CW加权训练。两种策略均提升了基于推理的基准测试中的OOD性能,二者组合可实现叠加性收益。

关键词

引用

@article{arxiv.2602.09448,
  title  = {The Wisdom of Many Queries: Complexity-Diversity Principle for Dense Retriever Training},
  author = {Xincan Feng and Noriki Nishida and Yusuke Sakai and Yuji Matsumoto},
  journal= {arXiv preprint arXiv:2602.09448},
  year   = {2026}
}

备注

Under review