大规模深度学习模型高效训练综述
机器学习
2023-04-10 v1 人工智能
分布式、并行与集群计算
摘要
深度学习领域取得了显著进展,尤其在计算机视觉(CV)、自然语言处理(NLP)和语音方面。使用在海量数据上训练的大规模模型对实际应用具有巨大前景,可提升工业生产力并促进社会的发展。随着对计算能力需求的不断增长,尽管大量研究已探索高效训练,但对深度学习模型训练加速技术的全面总结仍备受期待。本综述详细回顾了训练加速。我们考虑基本的更新公式并将其基本组成部分分为五个主要视角:(1)以数据为中心:包括数据集正则化、数据采样和以学生为中心的课程学习技术,可显著降低数据样本的计算复杂度;(2)以模型为中心:包括基础模块加速、压缩训练、模型初始化和以学生为中心的课程学习技术,侧重于通过减少参数计算来加速训练;(3)以优化为中心:包括学习率选择、大批量使用、高效目标设计和模型平均技术,关注训练策略并提升大规模模型的泛化性;(4)预算训练:包括在资源受限情形下的若干独特加速方法;(5)以系统为中心:包括一些高效的分布式开源库/系统,为加速算法实现提供充分的硬件支持。通过给出这一全面分类,本综述呈现了理解各组成部分内部通用机制及其联合相互作用的综合回顾。
引用
@article{arxiv.2304.03589,
title = {On Efficient Training of Large-Scale Deep Learning Models: A Literature Review},
author = {Li Shen and Yan Sun and Zhiyuan Yu and Liang Ding and Xinmei Tian and Dacheng Tao},
journal= {arXiv preprint arXiv:2304.03589},
year = {2023}
}
备注
60 pages