不遗漏任何参数:蒸馏与模型规模如何影响零样本检索
信息检索
2022-12-13 v5 计算与语言
性能
摘要
近期研究表明,在广泛的信息检索任务中,小型蒸馏语言模型是比规模与速度高出数个数量级的模型更具竞争力的对手。由于延迟限制,这使得蒸馏模型与稠密模型成为现实世界检索应用部署的首选。在本文中,我们质疑这一做法,指出参数数量与早期的查询-文档交互在检索模型的泛化能力中起着重要作用。我们的实验表明,增大模型规模在域内测试集上仅带来边际收益,但在微调期间从未见过的新领域上带来大得多的收益。此外,我们表明在多个任务中重排序器大幅优于规模相近的稠密模型。我们最大的重排序器在 Benchmark-IR (BEIR) 的 18 个数据集中的 12 个上达到最先进水平,并以平均 3 分的优势超越先前的最先进水平。最后,我们确认域内有效性并非零样本有效性的良好指标。代码可在 https://github.com/guilhermemr04/scaling-zero-shot-retrieval.git 获取。
引用
@article{arxiv.2206.02873,
title = {No Parameter Left Behind: How Distillation and Model Size Affect Zero-Shot Retrieval},
author = {Guilherme Moraes Rosa and Luiz Bonifacio and Vitor Jeronymo and Hugo Abonizio and Marzieh Fadaee and Roberto Lotufo and Rodrigo Nogueira},
journal= {arXiv preprint arXiv:2206.02873},
year = {2022}
}