中文

使用多个正例训练稠密检索器

核理论 2026-02-16 v1

摘要

现代知识密集型系统(如检索增强生成 (RAG))依赖于有效的检索器来决定下游模块的性能上限。然而,检索器的训练一直受到稀疏、单正例标注的瓶颈制约,这导致误判噪声和次优监督。尽管大型语言模型 (LLM) 的出现使得大规模收集全面的多正例相关性标签变得可行,但如何将这些稠密信号最佳地纳入训练仍然尚不明了。本文对检索器训练的多正例优化目标进行系统性研究。我们将代表性目标,包括联合似然 (Joint Likelihood, JointLH)、求和边际似然 (Summed Marginal Likelihood, SumMargLH) 和对数求和指数配对 (Log-Sum-Exp Pairwise, LSEPair) 损失,在统一的对比学习框架下进行统一处理。我们的理论分析刻画了这些目标在梯度行为上的差异,揭示了每个目标如何在正文档集合上分配概率质量。实验上,我们在 Natural Questions、MS MARCO 和 BEIR 基准上进行广泛评估,涵盖两个真实场景:均匀的 LLM 标注数据和人类与 LLM 标注的混合数据。我们的结果表明,LSEPair 在各种设置下始终实现更好的鲁棒性和性能,而 JointLH 和 SumMargLH 对正例质量高度敏感。此外,我们发现随机采样 (Rand1LH) 作为简单策略可作为可靠的基准。通过将理论洞察与实证发现相结合,我们为利用稠密、LLM 增强的监督信息以提升检索器效能提供了实用设计原则。

关键词

引用

@article{arxiv.2602.12726,
  title  = {Phase diagrams of BCS-BEC crossover in asymmetric nuclear matter},
  author = {K. D. Duan and X. L. Shang},
  journal= {arXiv preprint arXiv:2602.12726},
  year   = {2026}
}

备注

10 pages, 5 figures