中文

对抗攻击如何破坏看似稳定且准确的分类器

机器学习 2024-09-13 v2 人工智能

摘要

对抗攻击通过对输入数据看似无关紧要的修改,极大地改变了原本准确的学习系统的输出。矛盾的是,经验证据表明,即便是对于输入数据的大幅随机扰动具有鲁棒性的系统,仍易受其输入的小规模、易构造的对抗扰动的攻击。在此,我们表明这可被视为处理高维输入数据的分类器的一个基本特征。我们引入了一个简单、通用且可推广的框架,其中实际系统中观察到的关键行为以高概率出现——特别是(原本准确的)模型同时易遭受易构造的对抗攻击,以及对输入数据的随机扰动具有鲁棒性。我们确认在 standard 图像分类问题上训练的实际神经网络中直接观察到了相同现象,其中即便大的加性随机噪声也未能触发网络的对抗不稳定性。一个令人惊讶的结论是,即便分类器决策面与训练和测试数据之间微小的间隔,也可能掩盖对抗易感性,使其无法被随机采样的扰动检测到。因此,反直觉的是,在训练或测试中使用加性噪声对于消除或检测对抗样本是低效的,需要进行更严苛的对抗训练。

关键词

引用

@article{arxiv.2309.03665,
  title  = {How adversarial attacks can disrupt seemingly stable accurate classifiers},
  author = {Oliver J. Sutton and Qinghua Zhou and Ivan Y. Tyukin and Alexander N. Gorban and Alexander Bastounis and Desmond J. Higham},
  journal= {arXiv preprint arXiv:2309.03665},
  year   = {2024}
}

备注

11 pages, 8 figures, additional supplementary materials