基于轻量微调的半孪生双编码器神经排序模型
计算与语言
2022-03-03 v2 信息检索
摘要
基于 BERT 的神经排序模型(NRM)可以是交叉编码器或双编码器。两者之间,双编码器效率极高,因为所有文档都可以在实际查询时间之前被预处理。在这项工作中,我们展示了两种改进基于 BERT 的双编码器性能的方法。第一种方法是以轻量微调替代全量微调。我们考察了基于适配器、基于提示以及二者混合的轻量微调方法。第二种方法是开发半孪生模型,其中查询和文档以有限程度的差异被处理。该有限差异通过学习两个轻量微调模块来实现,而 BERT 的主语言模型在查询和文档间保持共享。我们提供了 monoBERT、TwinBERT 和 ColBERT 的广泛实验结果,在 Robust04、ClueWeb09b 和 MS-MARCO 数据集上评估了三个性能指标。结果证实轻量微调和半孪生都有助于显著改进基于 BERT 的双编码器。事实上,轻量微调对交叉编码器也有帮助。
引用
@article{arxiv.2110.14943,
title = {Semi-Siamese Bi-encoder Neural Ranking Model Using Lightweight Fine-Tuning},
author = {Euna Jung and Jaekeol Choi and Wonjong Rhee},
journal= {arXiv preprint arXiv:2110.14943},
year = {2022}
}
备注
10 pages, 4 figures