通过Token池化降低多向量检索的存储开销
信息检索
2024-09-24 v1 人工智能
计算与语言
摘要
近年来,以ColBERT为代表的多向量检索方法日益流行于神经信息检索。相较于在文档级别存储表示,这些方法在词级别存储表示,在跨域设置下展现出极强的检索性能。然而,大量关联向量的存储与内存需求仍是重要短板,阻碍实际应用。本文提出一种基于聚类的简单Token池化方法,以积极减少需存储的向量数量。该方法可在几乎不影响检索性能的前提下,将ColBERT索引的存储与内存占用降低50%。该方法还可进一步降低向量数量,使向量计数降低66%-75%,且在绝大多数数据集上的性能退化仍保持在5%以下。重要的是,此方法无需架构改动也无需查询时处理,可作为简单替代方案在任何ColBERT类模型上进行索引构建。
引用
@article{arxiv.2409.14683,
title = {Reducing the Footprint of Multi-Vector Retrieval with Minimal Performance Impact via Token Pooling},
author = {Benjamin Clavié and Antoine Chaffin and Griffin Adams},
journal= {arXiv preprint arXiv:2409.14683},
year = {2024}
}