以 0.1% 额外计算量超越缩放定律
计算与语言
2022-11-17 v2 人工智能
机器学习
摘要
扩展语言模型可提升性能,但伴随显著的计算成本。本文提出 UL2R,一种以相对极小的额外计算量大幅改进现有语言模型及其缩放曲线的方法。其核心思想是使用 UL2 的去噪器混合目标,对最先进的大语言模型(如 PaLM)继续训练若干步。我们表明,在几乎可忽略的额外计算成本且无需新数据源的情况下,我们能够在下游指标上大幅改善大语言模型的缩放特性。在本文中,我们使用 UL2R 继续训练 PaLM,引入了 8B、62B 和 540B 规模的一组新模型,称之为 U-PaLM。令人印象深刻的是,在 540B 规模下,我们展示了约 2 倍的计算节省率,其中 U-PaLM 以约一半的计算预算(即节省 4.4 million TPUv4 hours)达到了最终 PaLM 540B 模型相同的性能。我们进一步表明,这一改善的缩放曲线在具有挑战性的 BIG-Bench 任务上带来了“涌现能力”——例如,U-PaLM 在某些任务上远优于 PaLM,或以小得多的规模(62B 而非 540B)展现出更好的质量。总体而言,我们表明 U-PaLM 在许多少样本设定下优于 PaLM,即英文 NLP 任务(如常识推理、问答)、带思维链的推理任务(如 GSM8K)、多语言任务(MGSM、TydiQA)、MMLU 以及具有挑战性的 BIG-Bench 任务。最后,我们给出定性示例,展示 U-PaLM 在单跨和多跨填充方面的新能力。
引用
@article{arxiv.2210.11399,
title = {Transcending Scaling Laws with 0.1% Extra Compute},
author = {Yi Tay and Jason Wei and Hyung Won Chung and Vinh Q. Tran and David R. So and Siamak Shakeri and Xavier Garcia and Huaixiu Steven Zheng and Jinfeng Rao and Aakanksha Chowdhery and Denny Zhou and Donald Metzler and Slav Petrov and Neil Houlsby and Quoc V. Le and Mostafa Dehghani},
journal= {arXiv preprint arXiv:2210.11399},
year = {2022}
}
备注
V2 has updated references/related work