稠密检索的缩放定律
信息检索
2024-07-16 v2 计算与语言
摘要
扩大神经模型规模在众多任务中取得了显著进展,尤其是在语言生成领域。先前的研究发现,神经模型的性能通常遵循可预测的缩放定律,这与训练集大小和模型大小等因素相关。这一见解极具价值,尤其在大规模实验日益消耗大量资源的情况下。然而,由于检索指标的离散性以及检索任务中训练数据与模型大小之间的复杂关系,这种缩放定律在稠密检索中尚未得到充分探索。在本研究中,我们调查了稠密检索模型的性能是否像其他神经模型一样遵循缩放定律。我们提议使用对比对数似然作为评估指标,并使用不同参数数量实现且使用不同数量标注数据训练的稠密检索模型进行了广泛实验。结果表明,在我们的设置下,稠密检索模型的性能遵循与模型大小和标注数量相关的精确幂律缩放。此外,我们研究了流行数据增强方法下的缩放以评估标注质量的影响,并应用缩放定律找到了预算约束下的最佳资源分配策略。我们相信这些见解将极大有助于理解稠密检索模型的缩放效应,并为未来的研究工作提供有意义的指导。
引用
@article{arxiv.2403.18684,
title = {Scaling Laws For Dense Retrieval},
author = {Yan Fang and Jingtao Zhan and Qingyao Ai and Jiaxin Mao and Weihang Su and Jia Chen and Yiqun Liu},
journal= {arXiv preprint arXiv:2403.18684},
year = {2024}
}
备注
Accepted at SIGIR 2024. V2 fixes a bug in the experiments