中文

使学习稀疏检索适应长文档

信息检索 2023-05-31 v1 机器学习

摘要

学习稀疏检索(LSR)是一类将查询与文档转换为与词表对齐的稀疏权重向量的神经检索方法。尽管像 Splade 这样的 LSR 方法在短段落上表现良好,但它们处理更长文档的效果尚不清楚。我们研究了现有的用于将 LSR 适应长文档的聚合方法,发现近端打分对于 LSR 处理长文档至关重要。为利用该性质,我们提出将序列依赖模型(SDM)适配于 LSR 的两种变体:ExactSDM 与 SoftSDM。ExactSDM 仅假设精确的查询词依赖,而 SoftSDM 使用势函数建模查询词与其扩展词(即使用 transformer 的掩码语言建模头识别出的词)之间的依赖。在 MSMARCO Document 与 TREC Robust04 数据集上的实验表明,ExactSDM 与 SoftSDM 在不同文档长度约束下均优于现有 LSR 聚合方法。令人惊讶的是,SoftSDM 相较 ExactSDM 未提供任何性能增益。这表明在 LSR 中建模词项依赖并不需要软邻近匹配。总体而言,本研究为使用 LSR 处理长文档提供了见解,并提出了提升其性能的适配方法。

关键词

引用

@article{arxiv.2305.18494,
  title  = {Adapting Learned Sparse Retrieval for Long Documents},
  author = {Thong Nguyen and Sean MacAvaney and Andrew Yates},
  journal= {arXiv preprint arXiv:2305.18494},
  year   = {2023}
}

备注

SIGIR 2023