DeepSpeed 数据效率:通过高效数据采样与路由提升深度学习模型质量与训练效率
摘要
深度学习模型的最新进展以高昂的训练成本为代价。模型规模不断增大是根本原因之一,但另一个较少被强调的事实是,数据规模实际上正以与模型规模相似的速度增长,而训练成本与二者均成正比。相较于快速演进的模型架构,如何高效利用训练数据(尤其是昂贵的基础模型预训练)由于缺少专注于数据效率能力的便捷框架,既较少被探索又难以实现。为此,我们提出 DeepSpeed Data Efficiency,一个更好地利用数据、提升训练效率并改善模型质量的框架。具体而言,我们提出并组合了两种数据效率技术:通过通用课程学习库的高效数据采样,以及通过一种新颖的随机分层 token 丢弃技术的高效数据路由。对于 GPT-3 1.3B 语言模型预训练,我们的工作仅需 12.5 倍更少的数据/时间/成本(若在 Azure 上租用则为 46.3K)的基线仍保持 95% 的模型质量。对于 GPT-3 1.3B 与 BERT-large 预训练,我们的工作还能以最多 2 倍更少的数据/时间/成本达到相同模型质量,或在相同数据/时间/成本下取得更好的模型质量。DeepSpeed Data Efficiency 易于使用与调参,使我们能轻松将其应用于 GPT-3 MoE 模型预训练以及小尺度 GPT-2/ViT 微调等额外任务并验证其收益。
引用
@article{arxiv.2212.03597,
title = {DeepSpeed Data Efficiency: Improving Deep Learning Model Quality and Training Efficiency via Efficient Data Sampling and Routing},
author = {Conglong Li and Zhewei Yao and Xiaoxia Wu and Minjia Zhang and Connor Holmes and Cheng Li and Yuxiong He},
journal= {arXiv preprint arXiv:2212.03597},
year = {2024}
}
备注
Published in AAAI 2024 Main Technical Track. Equal contribution by the first 3 authors. Code has been released as a part of https://github.com/microsoft/DeepSpeed. Part of this paper is from our previous arxiv report (arXiv:2211.11586)