揭示神经网络参数学习中的漏洞及防御解释感知后门
机器学习
2024-03-26 v1 密码学与安全
计算机视觉与模式识别
摘要
可解释人工智能(XAI)策略在提升神经网络的理解度和可信度方面起着关键作用。然而,这些技术可能生成误导性解释。致盲攻击可通过在输入中添加视觉上不可察觉的伪影,显著改变机器学习算法的预测和解释,提供误导性信息,同时保持模型准确性。这对确保XAI方法的可靠性构成了严峻挑战。为确保XAI方法的可靠性,我们利用统计分析来突出致盲攻击后CNN权重的变化。我们引入了一种专门设计的方法,用于在评估阶段限制此类攻击的有效性,避免了额外训练的需要。我们建议的方法能防御大多数现代解释感知对抗攻击,在三种不同类型的攻击中,攻击成功率(ASR)降低约99%,原始解释与被防御(攻击后)解释之间的均方误差(MSE)降低约91%。
引用
@article{arxiv.2403.16569,
title = {Revealing Vulnerabilities of Neural Networks in Parameter Learning and Defense Against Explanation-Aware Backdoors},
author = {Md Abdul Kadir and GowthamKrishna Addluri and Daniel Sonntag},
journal= {arXiv preprint arXiv:2403.16569},
year = {2024}
}