基于袋采样与分组损失的长文档排序标签噪声信息检索方法
信息论
2022-03-15 v1 人工智能
math.IT
摘要
长文档检索(DR)一直是阅读理解和信息检索中的巨大挑战。近年来,预训练模型在长文档的检索阶段和排序中取得了良好效果。然而,长文档排序中仍存在若干关键问题,如数据标签噪声、长文档表示、负数据不平衡采样等。为消除标注数据的噪声并能够对搜索中的长文档进行合理的负采样,我们提出了袋采样方法和分组局部对比估计(LCE)方法。我们使用头、中、尾段落对长文档进行编码,并在检索阶段使用稠密检索生成候选数据。在排序阶段将检索数据划分为多个袋,并在每个袋中选择负样本。采样后,组合两种损失。第一种损失为LCE。为很好地适配袋采样,在查询和文档编码后,通过卷积层和最大池化提取每组全局特征,以提升模型对标注噪声影响的抵抗能力,最终计算LCE分组损失。值得注意的是,我们的模型在MS MARCO长文档排序排行榜上表现出优异性能。
引用
@article{arxiv.2203.06408,
title = {Information retrieval for label noise document ranking by bag sampling and group-wise loss},
author = {Chunyu Li and Jiajia Ding and Xing hu and Fan Wang},
journal= {arXiv preprint arXiv:2203.06408},
year = {2022}
}