面向验证神经网络对语义扰动的鲁棒性
机器学习
2020-06-16 v2 机器学习
摘要
在给定特定威胁模型下验证神经网络的鲁棒性是一项基础但具有挑战性的任务。虽然当前的验证方法主要关注输入实例的 范数威胁模型,但针对引起较大 范数扰动的语义对抗攻击(如色彩偏移和光照调整)的鲁棒性验证超出了它们的能力。为弥补这一差距,我们提出 \textit{Semantify-NN},一种针对语义扰动、与模型无关且通用的神经网络鲁棒性验证方法。通过简单地将我们提出的 \textit{语义扰动层}(SP-layers)插入任何给定模型的输入层,\textit{Semantify-NN} 是与模型无关的,并且任何基于 范数的验证工具都可用于验证模型对语义扰动的鲁棒性。我们阐述了设计 SP-layers 的原理,并提供了包括分别在色调、饱和度、亮度、明度、对比度和旋转空间中对图像分类的语义扰动示例。此外,提出了一种高效的精炼技术以进一步显著提升语义证书。在各种网络架构和不同数据集上的实验证明了 \textit{Semantify-NN} 相对于朴素地将语义扰动转换为 范数的基于 范数的验证框架的优越验证性能。结果表明 \textit{Semantify-NN} 能够支持针对广泛语义扰动的鲁棒性验证。代码见 https://github.com/JeetMo/Semantify-NN
引用
@article{arxiv.1912.09533,
title = {Towards Verifying Robustness of Neural Networks Against Semantic Perturbations},
author = {Jeet Mohapatra and Tsui-Wei and Weng and Pin-Yu Chen and Sijia Liu and Luca Daniel},
journal= {arXiv preprint arXiv:1912.09533},
year = {2020}
}
备注
CVPR 2020