重新思考稠密检索的小样本能力
计算与语言
2023-04-13 v1
摘要
小样本稠密检索(DR)旨在通过少量样本学习有效泛化到新颖搜索场景。尽管其重要,专门针对数据集与标准化评估协议的研究很少。因此,当前方法常求助于从监督数据集中随机采样以构建“少数据”设定,并在评估中使用不一致的训练策略,这给准确比较近期进展带来挑战。本文提出一个定制的 FewDR 数据集与统一评估基准。具体而言,FewDR 采用类间采样建立标准化的“小样本”设定,具有精确定义的类,降低了多轮采样的变异性。此外,该数据集被切分为基类与新类,允许 DR 模型在基类充足数据与新类少量样本上连续训练。该基准消除了新类泄露风险,提供了对 DR 模型小样本能力的可靠估计。我们广泛的实证结果显示,当前最先进的 DR 模型在标准小样本场景下仍面临挑战。我们的代码与数据将在 https://github.com/OpenMatch/ANCE-Tele 开源。
引用
@article{arxiv.2304.05845,
title = {Rethinking Dense Retrieval's Few-Shot Ability},
author = {Si Sun and Yida Lu and Shi Yu and Xiangyang Li and Zhonghua Li and Zhao Cao and Zhiyuan Liu and Deiming Ye and Jie Bao},
journal= {arXiv preprint arXiv:2304.05845},
year = {2023}
}
备注
Work in progress