中文

关于深度学习在降压FPGA上韧性的研究

机器学习 2020-01-03 v1 神经与进化计算

摘要

深度神经网络(DNN)天然计算密集且功耗高。现场可编程门阵列(FPGA)等硬件加速器是一种有前景的方案,可满足嵌入式和高性能计算(HPC)系统的这些需求。在FPGA以及CPU和GPU中,将电压激进地降至标称水平以下是最小化功耗的有效技术。遗憾的是,由于时序问题,当电压降至接近晶体管阈值时开始出现位翻转故障,从而产生韧性问题。本文实验评估了DNN训练阶段在FPGA(尤其是片上存储器)存在降压相关故障时的韧性。为此,我们实验评估了LeNet-5以及为CIFAR-10数据集专门设计的、采用修正线性单元(Relu)和双曲正切(Tanh)不同激活函数的网络的韧性。我们发现现代FPGA在极低电压水平下足够稳健,且低压相关故障可在训练迭代中自动被掩盖,因此无需像ECC那样昂贵的面向软件或硬件的故障缓解技术。约需多10%的训练迭代来弥补精度差距。该观察结果源于实际FPGA fabric上测得的相对较低的下压故障率(即<0.1%)。我们还通过随机生成的故障注入活动显著提高了LeNet-5网络的故障率,并观察到训练精度开始下降。当故障率增加时,采用Tanh激活函数的网络在精度上优于采用Relu的网络,例如当故障率为30%时精度差为4.92%。

关键词

引用

@article{arxiv.2001.00053,
  title  = {On the Resilience of Deep Learning for Reduced-voltage FPGAs},
  author = {Kamyar Givaki and Behzad Salami and Reza Hojabr and S. M. Reza Tayaranian and Ahmad Khonsari and Dara Rahmati and Saeid Gorgin and Adrian Cristal and Osman S. Unsal},
  journal= {arXiv preprint arXiv:2001.00053},
  year   = {2020}
}