面向永久故障的神经网络加速器可持续复用算法策略
机器学习
2024-12-24 v1 硬件体系结构
摘要
硬件故障是机器学习加速器日益增长的挑战,其中许多加速器基于 systolic array。当 systolic array 中的永久硬件故障发生时,现有解决方案包括局部化和隔离故障处理单元(PE),使用冗余PE进行重新执行,或在极端情况下对整个加速器进行进一步调查后报废。在本文中,我们提出了若干新颖算法方法,通过独特地整合故障组件的行为来缓解神经网络(NN)加速器中的永久硬件故障,而不是绕过它。为此,我们旨在实现对加速器的可持续使用,使故障硬件既不被绕过,也不被废弃,而是获得第二次生命。我们首先引入了一个基于 PyTorch 的 CUDA 加速 systolic array 模拟器,用于量化永久故障对连接两个 PE 的链路或权重寄存器中发生的影响,其中一个比特在 float32、float16 或 bfloat16 表示中固定为 0 或 1。随后,我们提出了针对部分粘滞故障的若干算法缓解技术,例如可逆比例或偏移激活和权重,或使用故障行为进行微调。值得注意的是,所提出的技术不需要任何硬件修改,仅依赖于广泛使用的基于 systolic array 的加速器的现有组件,例如归一化、激活和存储单元。广泛的实验评估使用在 MNIST、CIFAR-10 和 ImageNet 上训练的全连接和卷积 NN 显示,所提出的容错方法在准确率上与原始无故障准确率相匹配或接近。
关键词
引用
@article{arxiv.2412.16208,
title = {Algorithmic Strategies for Sustainable Reuse of Neural Network Accelerators with Permanent Faults},
author = {Youssef A. Ait Alama and Sampada Sakpal and Ke Wang and Razvan Bunescu and Avinash Karanth and Ahmed Louri},
journal= {arXiv preprint arXiv:2412.16208},
year = {2024}
}