利用蝶形分解降低 IPU 的内存需求
分布式、并行与集群计算
2023-09-19 v1 新兴技术
机器学习
摘要
高性能计算(HPC)在近几十年受益于多种改进,尤其在硬件平台方面,以在保持合理功耗水平的同时提供更强的处理能力。智能处理单元(IPU)是一种新型大规模并行处理器,旨在加速并行计算,具有大量处理核心与通过高速互连连接的高带宽片上存储组件。IPU 主要面向机器学习应用,然而,由于 GPU 与 IPU 之间的架构差异,特别是 IPU 上内存容量显著更小,必须考虑通过稀疏化缩减模型尺寸的方法。蝶形分解是全连接层与卷积层的知名替代方案。本文中,我们考察蝶形结构如何在 IPU 上实现,并研究其与 GPU 相比的行为与性能。实验结果表明,这些方法可提供 98.5% 的压缩率以减少巨大的内存需求,IPU 实现在蝶形与像素化蝶形上分别获得 1.3 倍和 1.6 倍的性能提升。在 CIFAR10 等真实数据集上我们还实现了 1.62 倍的训练时间加速。
引用
@article{arxiv.2309.08946,
title = {Reducing Memory Requirements for the IPU using Butterfly Factorizations},
author = {S. -Kazem Shekofteh and Christian Alles and Holger Fröning},
journal= {arXiv preprint arXiv:2309.08946},
year = {2023}
}