增强语义特征邻域鲁棒性验证的方法
机器学习
2022-09-13 v1
摘要
深度神经网络已被证明易受基于语义特征扰动输入的对抗攻击。现有的鲁棒性分析器能够推理语义特征邻域以提升网络的可靠性。然而,尽管这些技术取得了显著进展,它们仍难以扩展到深度网络和大邻域。在本工作中,我们引入VeeP,一种主动学习方法,将验证过程拆分为一系列较小的验证步骤,每一步提交给现有的鲁棒性分析器。其核心思想是利用先前的步骤来预测下一个最优步骤。最优步骤通过参数回归估计认证速度与敏感度来预测。我们在MNIST、Fashion-MNIST、CIFAR-10和ImageNet上评估VeeP,并表明其可分析各类特征的邻域:亮度、对比度、色调、饱和度和明度。我们表明,平均而言,在给定90分钟超时的情况下,VeeP在29分钟内验证了96%的可最大认证邻域,而现有的拆分方法平均在58分钟内验证了73%的可最大认证邻域。
引用
@article{arxiv.2209.05446,
title = {Boosting Robustness Verification of Semantic Feature Neighborhoods},
author = {Anan Kabaha and Dana Drachsler-Cohen},
journal= {arXiv preprint arXiv:2209.05446},
year = {2022}
}