图像块捷径:可解释代理模型高效发现黑盒漏洞
计算机视觉与模式识别
2021-04-26 v1 密码学与安全
机器学习
摘要
安全机器学习(ML)的一个重要支柱是系统性地缓解神经网络中的弱点,以使其能部署于关键应用。一类普遍的安全风险是习得捷径,即网络利用其决策中与真实任务无语义关联的伪相关。依赖此类捷径的网络面临对未见输入泛化不佳的风险。可解释性方法有助于揭示此类网络漏洞。然而,在许多技术中,若对网络的访问受限(即所谓黑盒设定),则无法直接应用。在使用第三方 ML 组件时此类设定十分常见。为应对该限制,我们提出一种利用按设计可解释的网络的检测方法,将其作为目标黑盒模型的代理。借助代理在自省上的保证,我们自动提取习得捷径的候选。其向黑盒的可迁移性以系统性方式验证。具体地,我们选用 BagNet 作为代理模型,其决策纯粹基于局部图像块。我们在自动驾驶数据集 A2D2 上证明,提取的图像块捷径显著影响了黑盒模型。通过高效识别此类基于图像块的漏洞,我们为更安全的 ML 模型作出贡献。
引用
@article{arxiv.2104.11691,
title = {Patch Shortcuts: Interpretable Proxy Models Efficiently Find Black-Box Vulnerabilities},
author = {Julia Rosenzweig and Joachim Sicking and Sebastian Houben and Michael Mock and Maram Akila},
journal= {arXiv preprint arXiv:2104.11691},
year = {2021}
}
备注
Under IEEE Copyright; accepted at the SAIAD (Safe Artificial Intelligence for Automated Driving) Workshop at CVPR 2021