局部本征维数指示对抗扰动
机器学习
2021-09-27 v1
摘要
机器学习模型对对抗扰动的脆弱性激发了对抗机器学习广泛领域下的大量研究。精巧的攻击可能使学习算法学到具有较差预测性能的决策函数或做出决策。在此背景下,越来越多的文献使用局部本征维数(LID)——一种描述刻画每个数据点所需最少潜变量数的局部度量——来检测对抗样本并随后缓解其影响。迄今的研究往往聚焦于将LID用作一种实用防御方法,却常未充分解释LID为何能检测对抗样本。本文中,我们推导了扰动数据点的LID值的下界与上界,并证明这些界(尤其是下界)与扰动幅度呈正相关。因此,我们表明受大量扰动的数据点相较未扰动样本具有更大的LID值,从而佐证了既往文献中对其的使用。此外,我们的实证验证在基准数据集上证明了这些界的有效性。
引用
@article{arxiv.2109.11803,
title = {Local Intrinsic Dimensionality Signals Adversarial Perturbations},
author = {Sandamal Weerasinghe and Tansu Alpcan and Sarah M. Erfani and Christopher Leckie and Benjamin I. P. Rubinstein},
journal= {arXiv preprint arXiv:2109.11803},
year = {2021}
}
备注
13 pages