理解永久故障对GPU并行管理与控制单元的影响
硬件体系结构
2023-10-03 v2
摘要
图形处理单元(GPU)被过度使用以加速高性能计算应用,并用于加速多个领域中的深度神经网络,其预期寿命可达多年。这些条件使GPU硬件面临(过早)老化,导致在常规的制造后测试之后出现永久故障。因此,迫切需要评估永久故障对GPU影响的技术,从而能够估计可靠性风险并可能加以缓解。在本文中,我们提出了一种评估影响GPU调度器和控制单元的永久故障效果的方法,这些是最具特性且承压最严重的资源,并给出了首批能够量化这些效果的数据。我们在门级GPU模型的调度器和控制器中刻画了超过5.83×10^5个永久故障效应。随后,我们通过插桩13个应用和两个卷积神经网络的代码,在软件中映射观察到的错误类别,注入了超过1.65×10^5个永久错误。我们的两级故障注入策略将评估时间从数百年的门级评估缩减至数百小时。我们发现,GPU并行管理单元中的故障可修改线程和warp的操作码、地址及状态。这些硬件永久错误的绝大部分(高达99%)会影响运行中的软件执行。影响指令操作或资源管理的错误会使代码挂起,而并行管理或控制流中45%的错误会引发静默数据损坏。
引用
@article{arxiv.2306.10856,
title = {Understanding the Effects of Permanent Faults in GPU's Parallelism Management and Control Units},
author = {Juan-David Guerrero-Balaguera and Josie E. Rodriguez Condia and Fernando F. dos Santos and Matteo Sonza and Paolo Rech},
journal= {arXiv preprint arXiv:2306.10856},
year = {2023}
}