中文

少量帮助事半功:通过利用小型语言模型提高大语言模型训练效率

机器学习 2024-10-25 v1 计算与语言

摘要

大型语言模型 (LLM) 开发的首要挑战之一是其沉重的预训练成本。通常,这种预训练涉及对大型语料库上进行自监督目标(如下一个标记预测)的优化。本文探索了一种有前景的范式,通过恰当地利用小型语言模型 (SLM) 来提高 LLM 预训练的效率和质量。具体而言,这种范式依赖于 SLM 既提供软标签作为额外的训练监督,又选择一小部分有价值("有信息性"和"困难")的训练样本。综合来看,这实现了对 SLM 的预测分布的有效传递,同时优先于特定的训练数据分布区域。经验上,这导致 LLM 训练时间缩短于标准训练,同时提高整体质量。理论上,我们发展了一个统计框架来系统性地研究 SLM 在启用高质量 LLM 训练中的实用性。具体而言,我们的框架刻画了 SLM 看似低质量的监督如何增强训练更强大的 LLM 的能力。此外,它还突显了对此类监督进行自适应利用的必要性,通过在 SLM 提供的软标签引入的偏差和方差之间取得平衡。我们通过在 Pile 数据集上利用 1.5B 参数的较小语言模型来提高 28 亿参数 LLM 的预训练来支撑我们的理论框架。

关键词

引用

@article{arxiv.2410.18779,
  title  = {A Little Help Goes a Long Way: Efficient LLM Training by Leveraging Small LMs},
  author = {Ankit Singh Rawat and Veeranjaneyulu Sadhanala and Afshin Rostamizadeh and Ayan Chakrabarti and Wittawat Jitkrittum and Vladimir Feinberg and Seungyeon Kim and Hrayr Harutyunyan and Nikunj Saunshi and Zachary Nado and Rakesh Shivanna and Sashank J. Reddi and Aditya Krishna Menon and Rohan Anil and Sanjiv Kumar},
  journal= {arXiv preprint arXiv:2410.18779},
  year   = {2024}
}