词汇表在学习稀疏表示排序中的作用
信息检索
2026-04-21 v2 计算与语言
摘要
诸如 SPLADE 之类的学习型稀疏检索(LSR)因其在高效语义第一阶段匹配的同时享有倒排索引的效率而日益受到关注。最近一项关于使用扩展词汇表训练 SPLADE 模型(ESPLADE)的工作被提出,旨在将查询和文档表示到具有不同词汇粒度的自定义词汇表的稀疏空间中。然而,在这项工作中,关于词汇表在 SPLADE 模型中的作用及其与检索效率和有效性的关系的研究并不多。为了研究这一点,我们构建了具有 10 万大小输出词汇表的 BERT 模型,一个使用 ESPLADE 预训练方法初始化,另一个随机初始化。在真实世界搜索点击日志上微调后,我们应用基于 logit 分数的查询和文档剪枝至最大尺寸,以进一步平衡效率。在我们的评估集上的实验结果表明,当应用剪枝时,在 BM25 下的计算预算内,这两个模型与 3.2 万大小的普通 SPLADE 模型相比是有效的。并且 ESPLADE 模型比随机词汇表模型更有效,同时具有相似的检索成本。结果表明,输出词汇表的大小和预训练权重在配置查询、文档及其在检索引擎中交互的表示规范方面发挥着作用,这超越了它们在 NLP 中的原始意义和目的。这些发现通过识别词汇表配置对高效有效检索的表示规范的重要性,为 LSR 提供了新的改进空间。
引用
@article{arxiv.2509.16621,
title = {The Role of Vocabularies in Learning Sparse Representations for Ranking},
author = {Hiun Kim and Tae Kwan Lee and Taeryun Won},
journal= {arXiv preprint arXiv:2509.16621},
year = {2026}
}
备注
fix citation style; add some previous work description at the beginning of section 3;