局部化不确定性攻击
机器学习
2021-06-18 v1 密码学与安全
计算机视觉与模式识别
机器学习
摘要
深度学习模型对对抗扰动的敏感性重新引发了人们对对抗样本的关注,并产生了大量攻击方法。然而,这些攻击大多未能涵盖人类难以察觉的大范围对抗扰动。在本文中,我们提出局部化不确定性攻击,这是一类针对确定性和随机分类器的新型威胁模型。在此威胁模型下,我们仅扰动分类器不确定的输入区域来生成对抗样本。为寻找此类区域,当分类器为随机时我们利用其预测不确定性,而当其为确定性时我们学习一个替代模型来分摊不确定性。与无差别扰动输入的 球或函数式攻击不同,我们的针对性改动更不易被察觉。在我们的威胁模型下考量时,这些攻击仍能产生强对抗样本;且样本与输入保持了更大程度的相似性。
引用
@article{arxiv.2106.09222,
title = {Localized Uncertainty Attacks},
author = {Ousmane Amadou Dia and Theofanis Karaletsos and Caner Hazirbas and Cristian Canton Ferrer and Ilknur Kaynar Kabul and Erik Meijer},
journal= {arXiv preprint arXiv:2106.09222},
year = {2021}
}
备注
CVPR 2021 Workshop on Adversarial Machine Learning in Computer Vision