面向神经搜索的中段训练语言模型基准评测
信息检索
2023-06-06 v1
摘要
中段训练方法旨在弥合掩码语言模型(MLM)预训练与最终检索微调之间的差距。近期诸如 CoCondenser、RetroMAE 和 LexMAE 等模型认为 MLM 任务不足以预训练用于检索的 transformer 网络,因此提出了各种任务来实现。受这些新颖方法启发,我们注意到所有这些模型使用了不同的微调协议,使得难以评估中段训练的益处。我们在本文中提出在相同微调条件下对 CoCondenser、RetroMAE 和 LexMAE 的基准评测。我们在不同集合(MS MARCO、Wikipedia 或 Tripclick)上比较各种微调协议和中段训练下的稠密与稀疏方法。我们使用额外的中段训练基线,例如在检索集合上的标准 MLM 微调,可选择由预测段落词频的 CLS 增强。对于稀疏方法,我们的研究表明这些方法间几乎无统计差异:微调过程越有效,这些模型间差异越小。对于稠密方法,使用 MS MARCO 作为中段训练集合的 RetroMAE 在几乎所有设置中均展示出优异结果。最后,我们表明在检索集合上进行中段训练(从而使语言模型适应它)是关键因素。总体而言,应采用更好的实验设置来评估中段训练方法。代码可在 https://github.com/naver/splade/tree/benchmarch-SIGIR23 获取。
引用
@article{arxiv.2306.02867,
title = {Benchmarking Middle-Trained Language Models for Neural Search},
author = {Hervé Déjean and Stéphane Clinchant and Carlos Lassance and Simon Lupart and Thibault Formal},
journal= {arXiv preprint arXiv:2306.02867},
year = {2023}
}