中文

低延迟检索中的浅层交叉编码器

信息检索 2024-04-01 v1 计算与语言

摘要

基于变换器的交叉编码器在文本检索中实现了最佳效果。然而,基于大型变换器模型(如 BERT 或 T5)的交叉编码器计算代价高昂,仅能在相对较小的延迟窗口内对少数文档进行评分。然而,保持搜索延迟低对于用户满意度和能源消耗至关重要。本文表明,较弱的浅层变换器模型(即层数有限的变换器)在受限于实际低延迟场景时表现优于全尺寸模型,因为它们能在相同预算内估计更多文档的相关性。我们进一步表明,浅层变换器可能受益于最近在推荐任务中显示出成功的广义二元交叉熵(gBCE)训练方案。我们的实验使用 TREC 深度学习 passage ranking 查询集,证明在低延迟场景下浅层和全尺寸模型都实现了显著提升。例如,当延迟限制为每查询 25ms 时,MonoBERT-Large(基于全尺寸 BERT 模型的交叉编码器)仅能在 TREC DL 2019 上实现 NDCG@10 为 0.431,而 TinyBERT-gBCE(基于 TinyBERT 训练的交叉编码器)达到 NDCG@10 为 0.652,相较 MonoBERT-Large 提升 51%。我们还表明,即使在无 GPU(例如使用 CPU 推理时,NDCG@10 仅下降 3%)的情况下,浅层交叉编码器也能有效工作,这使得即使没有专用硬件加速,交叉编码器也能实用。

关键词

引用

@article{arxiv.2403.20222,
  title  = {Shallow Cross-Encoders for Low-Latency Retrieval},
  author = {Aleksandr V. Petrov and Sean MacAvaney and Craig Macdonald},
  journal= {arXiv preprint arXiv:2403.20222},
  year   = {2024}
}

备注

Accepted by ECIR2024