对 DNN 解释系统的后门攻击
密码学与安全
2022-07-21 v3 人工智能
计算机视觉与模式识别
机器学习
摘要
可解释性对于理解深度神经网络(DNN)的内部机制至关重要,许多解释方法生成显著图以高亮对 DNN 预测贡献最大的输入图像部分。本文设计了一种后门攻击,仅通过注入肉眼不可见的触发器即可改变网络对输入图像生成的显著图,同时保持预测精度。该攻击依赖于向训练数据集中注入带触发器的中毒数据。显著图被纳入用于训练深度模型的目标函数的惩罚项中,其对模型训练的影响以触发器的存在为条件。我们设计了两类攻击:针对性攻击,强制对显著图进行特定修改;以及非针对性攻击,使原始显著图中顶部像素的重要性分数显著降低。我们在多种深度学习架构上对基于梯度和无梯度的解释方法进行了所提后门攻击的实证评估。我们表明,当部署由不可信来源开发的深度学习模型时,我们的攻击构成严重安全威胁。最后,在补充材料中我们展示了所提方法可用于反向设定:仅当存在触发器(密钥)时才能获得正确显著图,从而有效地使解释系统仅对选定用户可用。
引用
@article{arxiv.2011.10698,
title = {Backdoor Attacks on the DNN Interpretation System},
author = {Shihong Fang and Anna Choromanska},
journal= {arXiv preprint arXiv:2011.10698},
year = {2022}
}
备注
Published at the 2022 AAAI Conference on Artificial Intelligence (AAAI), 2022