中文

Reduce:一种降低故障感知重训练开销的框架

硬件体系结构 2023-05-23 v1

摘要

故障感知重训练已成为缓解深度神经网络(DNN)硬件加速器永久性故障的重要技术。然而,重训练会导致巨大的开销,特别是在用于微调为解决复杂问题而设计的大型DNN时。此外,由于每个 fabricated 芯片可能具有独特的故障模式,需要针对每个芯片根据其独特的故障图单独执行故障感知重训练,这进一步加剧了该问题。为降低整体重训练成本,本文引入弹性驱动的重训练量选择概念。为实现该概念,我们提出一种新颖的框架 Reduce,它首先计算给定DNN在不同故障率和不同重训练量下对故障的弹性;然后基于弹性,结合每个芯片独特的故障图计算其所需的重训练量。我们针对基于 systolic array 的DNN加速器在计算阵列中发生永久性故障的情况,展示了该方法的有效性。

关键词

引用

@article{arxiv.2305.12595,
  title  = {Reduce: A Framework for Reducing the Overheads of Fault-Aware Retraining},
  author = {Muhammad Abdullah Hanif and Muhammad Shafique},
  journal= {arXiv preprint arXiv:2305.12595},
  year   = {2023}
}

备注

2 pages, 3 figures. arXiv admin note: substantial text overlap with arXiv:2304.12949