众多查询之智慧:稠密检索训练的复杂度-多样性原理
信息检索
2026-03-17 v4 机器学习
摘要
合成查询生成已成为训练稠密检索器的必不可少的手段,但先前方法仅为每个文档生成一个查询,仅关注查询质量。我们首次系统性地研究了多查询合成,发现质量与多样性之间存在权衡:高质量查询在近义任务中受益,而多样化查询在跨域(OOD)泛化方面受益。通过在Contriever、RetroMAE和Qwen3-Embedding上进行4种基准类型的受控实验,我们发现多样性收益与查询复杂度高度相关(r≥0.95,p<0.05),以内容词(CW)近似表示。我们将此形式化为复杂度-多样性原理(CDP):查询复杂度决定最优多样性。基于CDP,我们提出复杂度感知训练:针对高复杂度任务进行多查询合成,针对现有数据进行CW加权训练。两种策略均提升了基于推理的基准测试中的OOD性能,二者组合可实现叠加性收益。
引用
@article{arxiv.2602.09448,
title = {The Wisdom of Many Queries: Complexity-Diversity Principle for Dense Retriever Training},
author = {Xincan Feng and Noriki Nishida and Yusuke Sakai and Yuji Matsumoto},
journal= {arXiv preprint arXiv:2602.09448},
year = {2026}
}
备注
Under review