中文

面向深度神经网络的中子诱发故障模型表征

硬件体系结构 2022-11-24 v1

摘要

在图形处理器(GPU)上执行的深度神经网络(DNN)的可靠性评估是一个具有挑战性的问题,因为硬件架构高度复杂且软件框架由多层抽象组成。虽然软件级故障注入是评估复杂应用可靠性的常见且快速的方法,但其可能产生不真实的结果,因为它对硬件资源的访问有限且采用的故障模型可能过于简单(即单比特和双比特翻转)。相反,中子束物理故障注入提供真实的错误率但缺乏故障传播可见性。本文提出了一种结合中子束实验与软件级故障注入的DNN故障模型表征。我们将运行通用矩阵乘法(GEMM)和DNN的GPU暴露于束流中子以测量其错误率。在DNN上,我们观察到关键错误比例可达61%,并表明ECC在减少关键错误方面无效。随后我们执行了补充的软件级故障注入,使用源自RTL仿真的故障模型。结果表明,通过注入复杂故障模型,YOLOv3的漏检率经验证非常接近束流实验测得的速率,比仅使用单比特翻转的故障注入测得者高8.66倍。

关键词

引用

@article{arxiv.2211.13094,
  title  = {Characterizing a Neutron-Induced Fault Model for Deep Neural Networks},
  author = {Fernando Fernandes dos Santos and Angeliki Kritikakou and Josie Esteban Rodriguez Condia and Juan David Guerrero Balaguera and Matteo Sonza Reorda and Olivier Sentieys and Paolo Rech},
  journal= {arXiv preprint arXiv:2211.13094},
  year   = {2022}
}