中文

从零预训练 Transformer 用于信息检索的实验研究

信息检索 2023-01-26 v1 计算与语言

摘要

自几年前预训练语言模型(PLM)取得突破性效果以来,为其微调(finetuning)用于 IR 已成为事实上的标准做法。但这种方法是否被充分理解?本文研究预训练语料库对最终 IR 效果的影响。我们尤其质疑当前“PLM 应在足够大的通用语料上训练”的假设,并表明在目标语料上从零预训练竟可与当前做法相媲美。我们在 MSMARCO 通用段落检索、Mr-Tydi(阿拉伯语、日语、俄语)与 TripClick(特定领域)任务上,对首轮排序 ranker 与用于重排序的 cross-encoder 进行基准测试。与普遍认知相反,我们表明对于首轮 ranker 的微调,仅在自身语料上预训练的模型相较于更通用的模型具有相当或更好的效果。然而,仅在目标语料上预训练的重排序器存在轻微效果下降。总体而言,本研究为预训练语料的作用提供了新视角,并应促使学界思考通过从零预训练构建专用模型。最后,这样做可更好地控制效率、数据偏差与可复现性,这些是 IR 界的关键研究问题。

关键词

引用

@article{arxiv.2301.10444,
  title  = {An Experimental Study on Pretraining Transformers from Scratch for IR},
  author = {Carlos Lassance and Hervé Déjean and Stéphane Clinchant},
  journal= {arXiv preprint arXiv:2301.10444},
  year   = {2023}
}

备注

Accepted at ECIR 2023