中文

度量样本级对抗脆弱性的整体方法及其在构建可信系统中的效用

计算机视觉与模式识别 2022-05-06 v1 人机交互 机器学习 机器学习

摘要

对抗攻击以难以察觉的噪声扰动图像,导致模型预测错误。最近,少数工作展示了此类攻击相关的固有偏差(鲁棒性偏差),即数据集中某些子组(例如基于类别、性别等)比其他子组更不鲁棒。这种偏差即使在对抗训练后依然存在,而且常导致这些子组间严重的性能差异。现有工作仅通过检查单个样本到决策边界的邻近程度来刻画子组的鲁棒性偏差。在本文中,我们认为这一度量 alone 并不充分,并通过广泛的实验分析验证了我们的论点。已观察到对抗攻击常破坏输入图像的高频分量。因此,我们提出一种整体方法,通过结合这些不同视角(即模型对高频特征依赖的程度与(常规的)样本到决策边界的距离)来量化样本的对抗脆弱性。我们证明,通过使用所提出的整体度量可靠地估计样本级对抗脆弱性,可以开发出一个可信系统,在其中可就测试时极可能被误分类的 incoming 样本向人类发出警报。当使用我们的整体度量而非单个度量时,这以更好的精度实现。为进一步证实所提整体方法的效用,我们在有限样本设置下执行知识蒸馏。我们观察到,使用基于我们组合度量选出的样本子集训练的学生网络,优于两个竞争基线,即随机选样或基于到决策边界距离选样。

关键词

引用

@article{arxiv.2205.02604,
  title  = {Holistic Approach to Measure Sample-level Adversarial Vulnerability and its Utility in Building Trustworthy Systems},
  author = {Gaurav Kumar Nayak and Ruchit Rawal and Rohit Lal and Himanshu Patil and Anirban Chakraborty},
  journal= {arXiv preprint arXiv:2205.02604},
  year   = {2022}
}

备注

Accepted in CVPR Workshop 2022 on Human-centered Intelligent Services: Safe and Trustworthy