缓解Transformer模型在段落重排序中的位置偏差
信息检索
2021-01-19 v1 计算与语言
摘要
有监督机器学习模型及其评估在很大程度上依赖于底层数据集的质量。当我们搜索相关信息时,它可能出现在给定段落中的任何位置。然而,我们观察到在用于段落重排序的两个流行问答数据集中,正确答案在文本中的位置存在偏差。对段落内较前位置的过度偏好是一种不期望的伪影。这导致三种常见的基于Transformer的重排序模型忽略未见段落中的相关部分。更令人担忧的是,由于评估集取自相同的有偏分布,这些过拟合该偏差的模型高估了其真实有效性。在这项工作中,我们分析了数据集上的位置偏差、上下文表示及其对检索结果的影响。我们提出了一种用于检索数据集的去偏方法。我们的结果表明,在位置有偏数据集上训练的模型在去偏数据集上评估时,重排序有效性显著下降。我们证明,通过缓解位置偏差,基于Transformer的重排序模型在有偏和去偏数据集上同样有效,并且在两个具有不同偏差的数据集之间的迁移学习设置中更为有效。
引用
@article{arxiv.2101.06980,
title = {Mitigating the Position Bias of Transformer Models in Passage Re-Ranking},
author = {Sebastian Hofstätter and Aldo Lipani and Sophia Althammer and Markus Zlabinger and Allan Hanbury},
journal= {arXiv preprint arXiv:2101.06980},
year = {2021}
}
备注
Accepted at ECIR 2021 (Full paper track)