面向稠密检索的噪声样本对纠正器
计算与语言
2023-11-08 v1
摘要
大多数稠密检索模型都隐含一个假设:训练所用的查询-文档对是精确匹配的。由于人工标注语料代价高昂,实际应用中的训练对通常通过自动方式收集,这不可避免地引入了不匹配样本对的噪声。本文探讨稠密检索中一个有趣且具有挑战性的问题:如何利用不匹配样本对噪声训练出有效的模型。为解决该问题,我们提出一种称为噪声样本对纠正器(Noisy Pair Corrector, NPC)的新方法,其由一个检测模块和一个纠正模块组成。检测模块通过计算标注正例文档与简单负例文档之间的困惑度来估计噪声样本对。纠正模块利用指数移动平均(EMA)模型提供软监督信号,有助于减轻噪声的影响。我们在文本检索基准 Natural Question 和 TriviaQA,以及代码搜索基准 StaQC 和 SO-DS 上进行了实验。实验结果表明,NPC 在处理合成噪声与真实噪声方面均取得了优异的性能。
引用
@article{arxiv.2311.03798,
title = {Noisy Pair Corrector for Dense Retrieval},
author = {Hang Zhang and Yeyun Gong and Xingwei He and Dayiheng Liu and Daya Guo and Jiancheng Lv and Jian Guo},
journal= {arXiv preprint arXiv:2311.03798},
year = {2023}
}
备注
Findings of EMNLP 2023