中文

基于上下文精确词项匹配与高效段落扩展的快速段落重排序

信息检索 2021-09-14 v2

摘要

基于 BERT 的信息检索模型在时间和(查询延迟)与计算资源(能耗、硬件成本)上均开销高昂,使得许多此类模型尤其在资源受限下不切实际。近期提出的 TILDE 方法仅依赖执行分词的查询编码器以及索引时段落表示的预处理,从而克服了基于 BERT 模型典型的高查询延迟问题。然而,这以相比其他基于 BERT 的重排序器与稠密检索器更低的效能为代价。此外,原始 TILDE 方法的特征是索引内存占用极高,因其将每个段落扩展至 BERT 词表大小。本文中,我们提出 TILDEv2,一种源自原始 TILDE 但解决其局限性的新模型。TILDEv2 依赖带扩展段落的上下文精确词项匹配。这只需在索引中存储扩展段落中出现过的词元得分(而非全部词表),从而生成比 TILDE 小 99% 的索引。该匹配机制还将排序效能提升 24%,且不增加查询延迟。这使 TILDEv2 成为仅 CPU 环境下最先进的段落重排序方法,能在商用硬件上将查询延迟维持在 100ms 以下。

关键词

引用

@article{arxiv.2108.08513,
  title  = {Fast Passage Re-ranking with Contextualized Exact Term Matching and Efficient Passage Expansion},
  author = {Shengyao Zhuang and Guido Zuccon},
  journal= {arXiv preprint arXiv:2108.08513},
  year   = {2021}
}

备注

10 pages