利用查询高效黑盒攻击揭示可解释深度学习系统的漏洞
计算机视觉与模式识别
2023-07-25 v1 密码学与安全
机器学习
摘要
深度学习已迅速应用于诸多领域并革新许多行业,但众所周知其易受对抗攻击。此类攻击对基于深度学习的系统构成严重威胁,损害其完整性、可靠性与信任。可解释深度学习系统(IDLSes)旨在使系统更透明和可解释,但也已被证明易受攻击。本工作中,我们提出一种新颖的基于微生物遗传算法的黑盒攻击,针对IDLSes,无需目标模型及其解释模型的先验知识。所提攻击是一种查询高效方法,结合了基于迁移和基于得分的方法,使其成为揭示IDLS漏洞的有力工具。我们的攻击实验显示出高攻击成功率,使用的对抗样本其归因图与良性样本高度相似,以至于即使人类分析员也难以检测。我们的结果凸显了提升IDLS安全性以保障其实际可靠性的必要。
引用
@article{arxiv.2307.11906,
title = {Unveiling Vulnerabilities in Interpretable Deep Learning Systems with Query-Efficient Black-box Attacks},
author = {Eldor Abdukhamidov and Mohammed Abuhamad and Simon S. Woo and Eric Chan-Tin and Tamer Abuhmed},
journal= {arXiv preprint arXiv:2307.11906},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:2307.06496