将领域自适应注入学习哈希以实现高效有效的零样本稠密检索
信息检索
2023-07-21 v2 人工智能
机器学习
摘要
稠密检索克服了词汇鸿沟,并在临时信息检索(IR)中取得了巨大成功。尽管取得了成功,稠密检索器在实际用例中服务成本高昂。对于需要从数百万文档中搜索的用例,稠密索引变得庞大,并且需要高内存来存储索引。最近,学习哈希(LTH)技术,例如 BPR 和 JPQ,生成二进制文档向量,从而降低了高效存储稠密索引的内存需求。LTH 技术是监督式的,并使用排序损失对检索器进行微调。它们优于传统开箱即用的向量压缩技术(如 PCA 或 PQ)等对应方法。先前工作的一个缺失环节是,现有技术仅在域内(即在 MS MARCO 等单一数据集上)进行了评估。在我们的工作中,我们评估了 LTH 和向量压缩技术,以在保持推理效率的同时提高 TAS-B 稠密检索器的下游零样本检索精度。我们的结果表明,与先前工作不同,朴素地应用 LTH 策略在 BEIR 基准上平均会使零样本 TAS-B 稠密检索器的 nDCG@10 降低多达 14%。为解决这一局限,我们在工作中提出了一种简单而有效的解决方案:将领域自适应注入现有的监督 LTH 技术中。我们尝试了两种著名的无监督领域自适应技术:GenQ 和 GPL。我们的领域自适应注入技术可以在保持 32 内存效率和 BEIR 上 CPU 检索延迟分别 14 和 2 加速的同时,将 TAS-B 模型的 BPR 和 JPQ 变体的下游零样本检索效果平均分别提高 11.5% 和 8.2% 的 nDCG@10。我们的所有代码、模型和数据均公开于 https://github.com/thakur-nandan/income。
引用
@article{arxiv.2205.11498,
title = {Injecting Domain Adaptation with Learning-to-hash for Effective and Efficient Zero-shot Dense Retrieval},
author = {Nandan Thakur and Nils Reimers and Jimmy Lin},
journal= {arXiv preprint arXiv:2205.11498},
year = {2023}
}
备注
Accepted at ReNeuIR 2023 Workshop