中文

用于第一阶段检索的复合编码稀疏自编码器

信息检索 2022-04-15 v1 人工智能

摘要

我们提出了一种基于 Siamese-BERT 模型的文档表示近似最近邻(ANN)搜索的复合编码稀疏自编码器(CCSA)方法。在信息检索(IR)中,排序流程通常分解为两个阶段:第一阶段聚焦于从整个集合中检索候选集;第二阶段依赖更复杂的模型对候选集重排序。近来,Siamese-BERT 模型已被用作第一阶段排序器以替代或补充传统的词袋模型。然而,索引与搜索大规模文档集合需要在稠密向量上进行高效相似度搜索,这正是 ANN 技术发挥作用之处。由于复合编码天然稀疏,我们首先展示了 CCSA 如何借助均匀性正则化学习高效的并行倒排索引。其次,CCSA 可用作二值量化方法,我们提出将其与近期基于图的 ANN 技术结合。在 MSMARCO 数据集上的实验表明,CCSA 优于采用乘积量化的 IVF。此外,CCSA 二值量化有益于基于图的 HNSW 方法的索引规模与内存使用,同时保持了良好的召回率与 MRR 水平。第三,我们与近期面向图像检索的监督量化方法进行比较,发现 CCSA 能够超越它们。

关键词

引用

@article{arxiv.2204.07023,
  title  = {Composite Code Sparse Autoencoders for first stage retrieval},
  author = {Carlos Lassance and Thibault Formal and Stephane Clinchant},
  journal= {arXiv preprint arXiv:2204.07023},
  year   = {2022}
}

备注

24 pages, longer version of short paper accepted at SIGIR 2021