中文

遭受攻击的可解释深度学习

密码学与安全 2019-09-19 v3 机器学习

摘要

为深度神经网络(DNN)模型提供解释对于其在安全敏感领域的应用至关重要。已有大量解释模型被提出,以帮助用户理解DNN的内部工作机制:对于给定的输入,DNN如何得出特定决策?人们认为,通过让人参与决策过程,改进的可解释性带来了一种安全感。然而,由于其数据驱动的本质,可解释性本身可能易受恶意操纵,而迄今为止对此知之甚少。本文通过首次对可解释深度学习系统(IDLSes)的安全性进行系统性研究来弥补这一空白。我们表明,现有的IDLSes极易受到对抗性操纵。具体而言,我们提出ADV^2,一类新的攻击,其生成的对抗样本不仅误导目标DNN,还欺骗与其耦合的解释模型。通过对基准数据集和安全关键应用(如皮肤癌诊断)中四类主要IDLSes的实证评估,我们证明利用ADV^2, adversary能够任意指定输入的预测结果与解释。进一步,通过分析和实证证据,我们确定预测-解释鸿沟是此漏洞的一个根本原因——DNN与其解释模型常常未对齐,从而导致同时利用两个模型的可能性。最后,我们探索针对ADV^2的潜在对策,包括利用其低迁移性并将其纳入对抗训练框架。我们的发现为以更安全、更具信息量的方式设计和运行IDLSes提供了启示,并引出若干有前景的研究方向。

关键词

引用

@article{arxiv.1812.00891,
  title  = {Interpretable Deep Learning under Fire},
  author = {Xinyang Zhang and Ningfei Wang and Hua Shen and Shouling Ji and Xiapu Luo and Ting Wang},
  journal= {arXiv preprint arXiv:1812.00891},
  year   = {2019}
}

备注

USENIX Security Symposium '20