高效扩展:来自 Transformer 预训练与微调的洞见
计算与语言
2022-02-01 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
关于 Transformer 架构的扩展行为仍存在许多开放问题。这些扩展决策与发现可能至关重要,因为训练运行通常伴随着具有财务和/或环境影响的计算成本。本文的目标是呈现来自预训练与微调 Transformer 的扩展洞见。尽管 Kaplan 等人提出了关于 Transformer 语言模型扩展行为的综合研究,但其范围仅局限于上游(预训练)损失。因此,这些发现是否在预训练-微调范式下的下游任务中成立仍不清楚。本文的关键发现如下:(1)我们表明除模型规模外,模型形状对下游微调也很重要;(2)扩展策略在不同计算区域表现不同;(3)被广泛采用的 T5-base 与 T5-large 规模是帕累托低效的。为此,我们提出了改进的扩展策略,其中我们重新设计的模型在达到相似下游微调质量的同时,相比广泛采用的 T5-base 模型参数量减少 50% 且训练速度提升 40%。我们公开发布了超过 100 个具有不同 T5 配置的预训练检查点,以促进未来的研究与分析。
引用
@article{arxiv.2109.10686,
title = {Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers},
author = {Yi Tay and Mostafa Dehghani and Jinfeng Rao and William Fedus and Samira Abnar and Hyung Won Chung and Sharan Narang and Dani Yogatama and Ashish Vaswani and Donald Metzler},
journal= {arXiv preprint arXiv:2109.10686},
year = {2022}
}
备注
ICLR 2022 + Updated Checkpoint Release