中文

基于轻量微调的半孪生双编码器神经排序模型

计算与语言 2022-03-03 v2 信息检索

摘要

基于 BERT 的神经排序模型(NRM)可以是交叉编码器或双编码器。两者之间,双编码器效率极高,因为所有文档都可以在实际查询时间之前被预处理。在这项工作中,我们展示了两种改进基于 BERT 的双编码器性能的方法。第一种方法是以轻量微调替代全量微调。我们考察了基于适配器、基于提示以及二者混合的轻量微调方法。第二种方法是开发半孪生模型,其中查询和文档以有限程度的差异被处理。该有限差异通过学习两个轻量微调模块来实现,而 BERT 的主语言模型在查询和文档间保持共享。我们提供了 monoBERT、TwinBERT 和 ColBERT 的广泛实验结果,在 Robust04、ClueWeb09b 和 MS-MARCO 数据集上评估了三个性能指标。结果证实轻量微调和半孪生都有助于显著改进基于 BERT 的双编码器。事实上,轻量微调对交叉编码器也有帮助。

关键词

引用

@article{arxiv.2110.14943,
  title  = {Semi-Siamese Bi-encoder Neural Ranking Model Using Lightweight Fine-Tuning},
  author = {Euna Jung and Jaekeol Choi and Wonjong Rhee},
  journal= {arXiv preprint arXiv:2110.14943},
  year   = {2022}
}

备注

10 pages, 4 figures