面向神经信息检索的广义弱监督
信息检索
2023-04-19 v1
摘要
神经排序模型(NRMs)已在若干信息检索(IR)任务中展现出有效性能。然而,训练NRMs通常需要大规模训练数据,而这类数据难以获取且代价高昂。为解决此问题,可通过弱监督训练NRMs,即利用现有排序模型(称为弱标注器)自动生成大规模数据集来训练NRMs。弱监督NRMs能够从观测数据中泛化,并显著优于弱标注器。本文通过迭代重标注过程推广了这一思想,证明弱监督模型可迭代地扮演弱标注器角色,并在不使用人工标注数据的情况下显著提升排序性能。所提出的广义弱监督(GWS)方案具有通用性,且与排序模型架构正交。本文给出了GWS的四种实现:自标注、交叉标注、交叉与自标注联合以及贪心多标注。GWS还受益于基于查询性能预测方法的查询重要性加权机制,以降低生成训练数据中的噪声。我们进一步建立了自标注与期望最大化(EM)之间的理论联系。我们在两个段落检索基准上的实验表明,相较于弱监督,所有GWS实现在各类情形下均带来实质性改进。
引用
@article{arxiv.2304.08912,
title = {Generalized Weak Supervision for Neural Information Retrieval},
author = {Yen-Chieh Lien and Hamed Zamani and W. Bruce Croft},
journal= {arXiv preprint arXiv:2304.08912},
year = {2023}
}