中文

增强语义特征邻域鲁棒性验证的方法

机器学习 2022-09-13 v1

摘要

深度神经网络已被证明易受基于语义特征扰动输入的对抗攻击。现有的鲁棒性分析器能够推理语义特征邻域以提升网络的可靠性。然而,尽管这些技术取得了显著进展,它们仍难以扩展到深度网络和大邻域。在本工作中,我们引入VeeP,一种主动学习方法,将验证过程拆分为一系列较小的验证步骤,每一步提交给现有的鲁棒性分析器。其核心思想是利用先前的步骤来预测下一个最优步骤。最优步骤通过参数回归估计认证速度与敏感度来预测。我们在MNIST、Fashion-MNIST、CIFAR-10和ImageNet上评估VeeP,并表明其可分析各类特征的邻域:亮度、对比度、色调、饱和度和明度。我们表明,平均而言,在给定90分钟超时的情况下,VeeP在29分钟内验证了96%的可最大认证邻域,而现有的拆分方法平均在58分钟内验证了73%的可最大认证邻域。

关键词

引用

@article{arxiv.2209.05446,
  title  = {Boosting Robustness Verification of Semantic Feature Neighborhoods},
  author = {Anan Kabaha and Dana Drachsler-Cohen},
  journal= {arXiv preprint arXiv:2209.05446},
  year   = {2022}
}