TransCODE:面向高效训练与推理的Transformer与加速器协同设计
机器学习
2023-03-28 v1 硬件体系结构
摘要
机器学习模型与评估硬件的自动化协同设计对于大规模高效部署此类模型至关重要。尽管 transformer 模型具有最先进的性能,它们尚未准备好在资源受限的硬件平台上执行。transformer 架构的高内存需求与低可并行性加剧了该问题。近期提出的加速器试图优化 transformer 模型的吞吐量与能耗。然而,此类工作要么局限于模型架构的单方面搜索,要么局限于受限的现成设备集合。此外,先前工作仅加速模型推理而非训练,而训练需要显著更高的内存与计算资源,使问题更具挑战性。为应对这些局限,本工作提出一种称为 DynaProp 的动态训练框架,可加速训练过程并降低内存消耗。DynaProp 是一种低开销剪枝方法,在运行时对激活和梯度进行剪枝。为在硬件上针对多样化 transformer 架构有效执行该方法,我们提出 ELECTOR,一个在加速器设计空间上仿真 transformer 推理与训练的框架。我们将该仿真器与提出的协同设计技术 TransCODE 结合使用,以获得在给定任务上高精度的最佳性能模型,并最小化延迟、能耗与芯片面积。所获得的 transformer-加速器配对比最先进配对精度高 0.3%,同时延迟降低 5.2、能耗降低 3.0。
引用
@article{arxiv.2303.14882,
title = {TransCODE: Co-design of Transformers and Accelerators for Efficient Training and Inference},
author = {Shikhar Tuli and Niraj K. Jha},
journal= {arXiv preprint arXiv:2303.14882},
year = {2023}
}