PLAID的可重复性研究
信息检索
2024-04-24 v1 计算与语言
摘要
用于ColBERTv2的PLAID(性能优化的后期交互驱动)算法使用聚类词项表示来检索并逐步剪枝文档,以进行最终(精确)文档评分。本文重现并填补了原始工作中的缺失部分。通过研究PLAID引入的参数,我们发现其帕累托前沿由三个参数之间的谨慎平衡构成;偏离建议设置可能会显著增加延迟而不一定提高有效性。然后我们将PLAID与论文中缺失的一个重要基线进行比较:对词法系统进行重排序。我们发现,将ColBERTv2作为重排序器应用于BM25结果的初始池,在低延迟设置下提供了更好的效率-有效性权衡。然而,由于词法匹配的召回率限制,重排序在高延迟设置下无法达到峰值有效性,并且对穷举ColBERTv2搜索的近似效果较差。我们发现最近提出的重排序修改(拉入高分文档的邻居)克服了这一限制,在使用良好标注的数据集评估时,为ColBERTv2提供了跨越所有操作点的帕累托前沿。出于对重排序方法为何与PLAID高度竞争的好奇,我们分析了PLAID用于检索的词项表示聚类,发现大多数聚类主要与单个词项对齐,反之亦然。鉴于重排序基线表现出的竞争性权衡,这项工作强调了在评估检索引擎效率时仔细选择相关基线的重要性。
引用
@article{arxiv.2404.14989,
title = {A Reproducibility Study of PLAID},
author = {Sean MacAvaney and Nicola Tonellotto},
journal= {arXiv preprint arXiv:2404.14989},
year = {2024}
}
备注
SIGIR 2024 (reproducibility track)