引入神经全词词袋与 ColBERTer:基于增强约简的上下文延迟交互
信息检索
2022-03-25 v1 人工智能
计算与语言
机器学习
摘要
神经信息检索近期的进展在效果上展示了巨大提升,但相较于经典方法,往往牺牲了神经模型的效率与可解释性。本文提出 ColBERTer,一种采用增强约简的上下文延迟交互(ColBERT)神经检索模型。在效果帕累托前沿上,ColBERTer 的约简大幅降低了 ColBERT 的存储需求,同时提升了其词元匹配分数的可解释性。为此,ColBERTer 将单向量检索、多向量精排与可选的词典匹配组件融合为单一模型。对于其多向量组件,ColBERTer 通过学习每个文档中词项的独特全词表示,并学习识别与移除对有效打分非必需的词表示,从而减少每篇文档存储的向量数。我们采用显式的多任务、多阶段训练,以促成使用极小的向量维度。在 MS MARCO 与 TREC-DL 数据集上的结果表明,ColBERTer 可在保持效果的同时将存储占用降低至多 2.5 倍。在其最小设置下每词元仅一维时,ColBERTer 实现了与明文大小相当的索引存储,且效果非常强。最后,我们在七个高质量域外数据集上展示了 ColBERTer 的鲁棒性,相较传统检索基线取得了统计显著的提升。
引用
@article{arxiv.2203.13088,
title = {Introducing Neural Bag of Whole-Words with ColBERTer: Contextualized Late Interactions using Enhanced Reduction},
author = {Sebastian Hofstätter and Omar Khattab and Sophia Althammer and Mete Sertkan and Allan Hanbury},
journal= {arXiv preprint arXiv:2203.13088},
year = {2022}
}