重复与否:来自 token 危机下大模型缩放的洞察
机器学习
2023-10-10 v2 人工智能
计算与语言
摘要
近期研究强调了数据集规模在缩放语言模型中的重要性。然而,大型语言模型(LLM)在预训练期间以 token 消耗巨大而著称,且网络上高质量文本数据正逼近其对 LLM 的缩放极限。为进一步增强 LLM,一种直接的方法是将预训练数据重复多个 epoch。在本研究中,我们实证地考察了该方法下的三个关键方面。首先,我们探究重复预训练数据的后果,揭示模型易受过拟合影响,导致多 epoch 退化。其次,我们审视导致多 epoch 退化的关键因素,发现显著因素包括数据集规模、模型参数与训练目标,而影响力较小的因素有数据集质量与模型 FLOPs。最后,我们探讨广泛使用的正则化能否缓解多 epoch 退化。大多数正则化技术未带来显著改进,除 dropout 外——其展现出卓越有效性,但在放大模型规模时需谨慎调参。此外,我们发现利用混合专家(MoE)能够以经济高效的方式,为具有可比可训练参数的计算密集型稠密 LLM 进行超参数调优,这可能更广泛地影响高效 LLM 的开发。
引用
@article{arxiv.2305.13230,
title = {To Repeat or Not To Repeat: Insights from Scaling LLM under Token-Crisis},
author = {Fuzhao Xue and Yao Fu and Wangchunshu Zhou and Zangwei Zheng and Yang You},
journal= {arXiv preprint arXiv:2305.13230},
year = {2023}
}
备注
Accepted at NeurIPS 2023