面向大规模流式稠密检索的 PLAID SHIRTTT
信息检索
2024-05-03 v1 计算与语言
摘要
PLAID 是 ColBERT 晚期交互双编码器的一种高效实现,使用预训练语言模型进行排序,在单语、跨语言和多语言检索中始终取得 SOTA 性能。PLAID 与 ColBERT 的不同之处在于,它将术语分配到簇中,并将这些术语表示为簇质心加上压缩残差向量。虽然 PLAID 在批处理实验中很有效,但在文档随时间到达的流式设置中,其性能会下降,因为新词元的表示可能无法被用于选择簇质心的早期词元很好地建模。PLAID Streaming Hierarchical Indexing that Runs on Terabytes of Temporal Text(PLAID SHIRTTT)通过基于分层分片的多阶段增量索引解决了这一问题。在 ClueWeb09 和多语言 NeuCLIR 集合上的实验分别证明了该方法对于 ColBERT 架构迄今为止索引的最大集合以及多语言设置的有效性。
引用
@article{arxiv.2405.00975,
title = {PLAID SHIRTTT for Large-Scale Streaming Dense Retrieval},
author = {Dawn Lawrie and Efsun Kayi and Eugene Yang and James Mayfield and Douglas W. Oard},
journal= {arXiv preprint arXiv:2405.00975},
year = {2024}
}
备注
5 pages, 1 figure, accepted at SIGIR 2024 as short paper