通过嵌入对齐进行查询编码器蒸馏是提升稠密检索器在线效率的强基线方法
信息检索
2023-06-21 v1 人工智能
摘要
信息检索社区在提升双编码器(DE)稠密段落检索系统的效率方面取得了显著进展,使其适用于对延迟敏感的场景。然而,许多提出的方法通常过于复杂或资源消耗过大,这使得从业者难以采用它们或识别经验性收益的来源。因此,在本工作中,我们提出了一种极其简单的方法,作为利用非对称架构提升 DE 检索器效率的基线方法。我们的结果表明,通过无监督蒸馏和适当的学生模型初始化,即使是 2 层基于 BERT 的查询编码器,在 BEIR 基准上仍能保留 92.5% 的完整 DE 性能。我们希望我们的发现能鼓励社区重新评估方法复杂性与性能提升之间的权衡。
引用
@article{arxiv.2306.11550,
title = {Query Encoder Distillation via Embedding Alignment is a Strong Baseline Method to Boost Dense Retriever Online Efficiency},
author = {Yuxuan Wang and Hong Lyu},
journal= {arXiv preprint arXiv:2306.11550},
year = {2023}
}
备注
Accepted by the 4th SustaiNLP workshop at ACL 2023