千亿标记数据存储下的检索式语言模型规模化研究
计算与语言
2024-07-19 v1 人工智能
信息检索
机器学习
摘要
训练数据量和参数数量之间的规模化定律,使我们能够预测在不同配置下进行语言模型预训练的成本效益权衡。本文考虑了另一维度的规模化:推理时可用数据的量。具体而言,我们发现增加检索式 LM 使用的数据存储大小,单调提升语言建模和多个下游任务的性能(此类任务尚无显著饱和现象),使得一个规模较小的模型搭配大型数据存储,可在知识密集型任务上超越更大规模的仅模型方法。通过绘制不同数据存储、模型和预训练数据规模下的计算最优规模曲线,我们表明,使用更大的数据存储可在相同的训练计算预算下显著提升模型性能。我们通过构建名为 MassiveDS 的1.4万亿标记数据存储(目前最大且最具多样性的开源检索式 LM 数据存储),并设计高效管道来可及的方式研究数据存储规模化,来完成本次研究。最终,我们分析了改进检索器、数据存储质量过滤以及其他设计选择对观察到的规模化趋势的影响。总体而言,我们的结果表明,数据存储大小应被视为语言模型效率和性能权衡的重要组成部分。为促进未来研究,我们开源了数据存储和代码 https://github.com/RulinShao/retrieval-scaling。
引用
@article{arxiv.2407.12854,
title = {Scaling Retrieval-Based Language Models with a Trillion-Token Datastore},
author = {Rulin Shao and Jacqueline He and Akari Asai and Weijia Shi and Tim Dettmers and Sewon Min and Luke Zettlemoyer and Pang Wei Koh},
journal= {arXiv preprint arXiv:2407.12854},
year = {2024}
}