中文

两步式SPLADE:SPLADE的简单、高效且有效的近似方法

信息检索 2024-04-23 v1

摘要

学习稀疏模型如SPLADE已成功展示了如何将最先进的神经信息检索模型的优势融入经典倒排索引数据结构中。尽管提高了有效性,但学习稀疏模型不如经典稀疏模型(如BM25)高效。近期开发的策略(如引导遍历查询处理和静态剪枝)在不同程度上解决了这一问题,效果在领域内和领域外数据集上各不相同。本文提出一种新的SPLADE查询处理策略,基于两阶段级联。第一阶段使用被剪枝和重新加权的SPLADE稀疏向量,第二阶段使用原始SPLADE向量对第一阶段检索的样本文档进行重新排序。我们的广泛实验在30个不同领域内外数据集上表明,所提出的策略在领域内数据集上可将原始单阶段SPLADE处理的平均响应时间和尾部响应时间分别提高最高可达30×30\times40×40\times,在领域外数据集上可将平均响应时间提高12倍至25倍,而在60%的数据集上未产生统计显著差异。

关键词

引用

@article{arxiv.2404.13357,
  title  = {Two-Step SPLADE: Simple, Efficient and Effective Approximation of SPLADE},
  author = {Carlos Lassance and Hervé Dejean and Stéphane Clinchant and Nicola Tonellotto},
  journal= {arXiv preprint arXiv:2404.13357},
  year   = {2024}
}

备注

published in Findings at ECIR'24