论人工智能系统中的对抗样本与隐蔽攻击
机器学习
2021-01-01 v1 人工智能
摘要
在这项工作中,我们提出了一个形式化理论框架,用于评估和分析针对通用人工智能(AI)系统的两类恶意行为。我们的结果适用于从输入空间映射到决策空间的通用多类分类器,包括深度学习应用中使用的人工神经网络。我们考虑了两类攻击。第一类涉及对抗样本,关注于引入导致误分类的输入数据的微小扰动。第二类在此首次提出并命名为隐蔽攻击(stealth attacks),涉及对AI系统本身的微小扰动。在此,被扰动后的系统在特定的小数据集(甚至可能是单个输入)上产生攻击者所期望的任何输出,但在验证集(攻击者未知)上表现正常。我们表明,在这两种情况下,即基于对抗样本的攻击和隐蔽攻击的情况下,AI决策空间的维度是其易受影响程度的主要贡献因素。对于基于对抗样本的攻击,第二个关键参数是数据概率分布中缺乏局部集中,这一性质被称为涂抹绝对连续性(Smeared Absolute Continuity)。根据我们的发现,对对抗样本的鲁棒性要求要么(a)AI特征空间中的数据分布具有集中的概率密度函数,要么(b)AI决策变量的维度足够小。我们还展示了如何对高维AI系统构造难以察觉的隐蔽攻击,除非验证集呈指数级增大。
引用
@article{arxiv.2004.04479,
title = {On Adversarial Examples and Stealth Attacks in Artificial Intelligence Systems},
author = {Ivan Y. Tyukin and Desmond J. Higham and Alexander N. Gorban},
journal= {arXiv preprint arXiv:2004.04479},
year = {2021}
}