中文

超越对比学习:合成数据实现多关节度排序训练

信息检索 2025-11-05 v2 计算与语言 机器学习

摘要

尽管合成数据已改变信息检索(IR)管道的各个方面,但主要训练范式仍然是:基于二元相关标签的对比学习,其中一个正文档与多个负文档使用 InfoNCE 损失进行比较。该目标将所有未明确标注为相关的文档均视为等度的负样本,无论其实际相关程度如何,从而错失了有助于排序的细微细节。为克服这一限制,本文我们放弃真实文档和标注,改用大语言模型直接生成根据不同相关程度水平生成的合成文档。我们还提出使用 Wasserstein 距离作为训练带有分层相关标签的 transformer 型检索器更有效的损失函数。我们的实验在 MS MARCO 和 BEIR 基准上表明,我们提出的方法在常规基于 InfoNCE 的训练中取得显著优势。无需使用任何真实文档,我们的方法显著改进了自监督检索器,并在与使用真实数据的对比学习相比更能抵御分布迁移。我们的方法还成功地将现有的真实数据集成到合成排序上下文中,进一步提升了性能。总体而言,我们表明,生成多关节度排序语境是合成数据生成用于 IR 的更佳方法,而不仅仅是生成标准的正负文档。

关键词

引用

@article{arxiv.2503.23239,
  title  = {Beyond Contrastive Learning: Synthetic Data Enables List-wise Training with Multiple Levels of Relevance},
  author = {Reza Esfandiarpoor and George Zerveas and Ruochen Zhang and Macton Mgonzo and Carsten Eickhoff and Stephen H. Bach},
  journal= {arXiv preprint arXiv:2503.23239},
  year   = {2025}
}

备注

Findings of the EMNLP 2025