零样本搜索中稠密检索器的选择问题
信息检索
2023-09-19 v1 人工智能
摘要
我们提出一个新问题:当在一个无标注可用的新集合上搜索时(即零样本设定下)如何选择使用哪种稠密检索模型。许多稠密检索模型已随时可用。然而,各模型搜索效果差异极大——不仅体现在学习稠密表示的数据集测试部分,关键也体现在未用于学习稠密表示的不同数据集上。这是因为稠密检索器通常需大量标注数据训练以在特定数据集或领域达满意效果。此外,稠密检索器在训练时可观察标注的数据集上获得的效果提升,未必能泛化至训练时未观察的数据集。但此为难题:经实证实验,我们发现受计算机视觉与机器学习中带域偏移的无监督性能评估近期工作启发的若干方法,在我们的设定中无法有效选出高性能稠密检索器。若存在无需收集标注评估即可在零样本设定选择稠密检索模型的可靠方法,将推动稠密检索的广泛采用。因此这是一个我们认为信息检索界应重视的重要新问题。方法实现、原始结果文件与分析脚本已公开于 https://www.github.com/anonymized。
引用
@article{arxiv.2309.09403,
title = {Selecting which Dense Retriever to use for Zero-Shot Search},
author = {Ekaterina Khramtsova and Shengyao Zhuang and Mahsa Baktashmotlagh and Xi Wang and Guido Zuccon},
journal= {arXiv preprint arXiv:2309.09403},
year = {2023}
}