中文

eFAT:提升故障感知训练在缓解 DNN 硬件加速器永久故障中有效性的方法

硬件体系结构 2023-04-26 v1 机器学习

摘要

故障感知训练(FAT)已成为应对 DNN 加速器中永久故障的一种高效技术,因为它能在低和中度故障率下以不显著的性能或精度损失实现故障缓解。然而,它带来了极高的重训练开销,尤其当用于为复杂 AI 应用设计的大型 DNN 时。此外,由于每个 fabricated 芯片可能具有独特的故障模式,FAT 需针对每个故障芯片根据其独特故障图分别执行,这进一步加剧了该问题。为在保持 FAT 收益的同时降低其开销,我们提出(1)弹性驱动的重训练量选择概念,以及(2)弹性驱动的多个故障图(属于不同芯片)的分组与融合,以对一组故障芯片执行整合重训练。为实现这些概念,本文提出一种新颖框架 eFAT,其计算给定 DNN 在不同故障率和不同重训练程度下对故障的弹性,并利用该知识在用户定义的精度约束下构建弹性图。随后,它使用弹性图结合各芯片独特故障图计算每颗芯片所需的重训练量。之后,它执行弹性和奖励驱动的故障图分组与融合,以进一步减少为给定故障芯片集调优该 DNN 所需的重训练迭代次数。我们针对基于 systolic array 的 DNN 加速器在计算阵列中发生永久故障的情形展示了框架有效性。针对大量芯片的广泛结果表明,所提技术用于为多个故障芯片调优 DNN 时显著降低了重训练成本。

关键词

引用

@article{arxiv.2304.12949,
  title  = {eFAT: Improving the Effectiveness of Fault-Aware Training for Mitigating Permanent Faults in DNN Hardware Accelerators},
  author = {Muhammad Abdullah Hanif and Muhammad Shafique},
  journal= {arXiv preprint arXiv:2304.12949},
  year   = {2023}
}

备注

8 pages, 13 figures