终端脑损伤:揭示深度神经网络在硬件故障攻击下的不优雅退化
密码学与安全
2019-06-05 v1 机器学习
摘要
深度神经网络(DNNs)已被证明能够容忍“脑损伤”:对网络参数的累积改变(例如剪枝、数值扰动)通常导致分类精度的优雅退化。然而,在 DNN 参数底层内存表示遭受微小对抗性改变(如硬件故障攻击可能引发的位翻转)时,这种自然韧性的极限尚不被很好理解。我们研究了按位损坏对 19 个 DNN 模型——三个图像分类任务上的六种架构——的影响,并表明大多数模型至少有一个参数,在其按位表示发生特定位翻转后,导致超过 90% 的精度损失。我们采用简单启发式方法高效识别可能脆弱的参数。我们估计模型中 40-50% 的参数在单独遭受此类单比特扰动时可能导致大于 10% 的精度下降。为演示攻击者如何利用此漏洞,我们研究了一个典型硬件故障攻击 Rowhammer 对 DNNs 的影响。具体而言,我们展示一个共置于同一物理机器中且启用 Rowhammer 的攻击者在单比特翻转损坏且不知晓模型的情况下,即可造成显著的精度下降(高达 99%)。我们的结果暴露了 DNNs 对真实世界故障攻击所致参数扰动的韧性极限。我们最后讨论了可能的缓解措施与朝向抗故障攻击 DNNs 的未来研究方向。
引用
@article{arxiv.1906.01017,
title = {Terminal Brain Damage: Exposing the Graceless Degradation in Deep Neural Networks Under Hardware Fault Attacks},
author = {Sanghyun Hong and Pietro Frigo and Yiğitcan Kaya and Cristiano Giuffrida and Tudor Dumitraş},
journal= {arXiv preprint arXiv:1906.01017},
year = {2019}
}
备注
Accepted to USENIX Security Symposium (USENIX) 2019