中文

解释不可轻信:针对可解释深度学习的隐蔽且有效的对抗扰动

密码学与安全 2022-11-30 v1 计算机视觉与模式识别 机器学习

摘要

深度学习方法因其卓越性能而在各类应用中受到越来越多的关注。为探究这种高性能与数据伪像的恰当使用以及给定任务准确问题表述之间的关系,解释模型已成为开发基于深度学习的系统中的一个关键组成部分。解释模型使人们能够理解深度学习模型的内部工作机制,并在检测输入数据中伪像的误用方面提供一种安全感。与预测模型类似,解释模型同样易受对抗输入的攻击。本工作提出两种攻击方法 AdvEdge 和 AdvEdge+^{+},它们能够同时欺骗目标深度学习模型及其耦合的解释模型。我们针对两种深度学习模型架构与四类代表不同解释模型类别的解释模型,评估了所提攻击的有效性。我们的实验包括使用多种攻击框架实现攻击,并探讨了针对此类攻击的潜在对策。分析表明,我们的攻击在欺骗深度学习模型及其解释器方面是有效的,并揭示了改进和规避这些攻击的见解。

关键词

引用

@article{arxiv.2211.15926,
  title  = {Interpretations Cannot Be Trusted: Stealthy and Effective Adversarial Perturbations against Interpretable Deep Learning},
  author = {Eldor Abdukhamidov and Mohammed Abuhamad and Simon S. Woo and Eric Chan-Tin and Tamer Abuhmed},
  journal= {arXiv preprint arXiv:2211.15926},
  year   = {2022}
}