来自元胞自动机的对抗图灵斑图
神经与进化计算
2021-04-07 v3 人工智能
机器学习
摘要
最先进的深度分类器令人费解地易受通用对抗扰动的影响:幅度小且单一的扰动会导致大多数输入被误分类。这一现象可能导致严重的安全问题。尽管该领域研究广泛,但对这些扰动结构的理论理解仍然缺乏。在图像领域,代表这些扰动的斑图与经典图灵斑图之间存在某种视觉相似性,后者作为非线性偏微分方程的解出现,是自然界许多过程的底层概念。在本文中,我们通过将一种简化的通用扰动构造算法映射到(非均匀)元胞自动机(后者已知可生成图灵斑图),在这两个不同理论之间提供了理论桥梁。此外,我们提出使用元胞自动机生成的图灵斑图作为通用扰动,并通过实验表明它们显著降低了深度学习模型的性能。我们发现该方法在黑盒场景下是创建数据不可知准不可感知扰动的快速高效方式。源代码可在 https://github.com/NurislamT/advTuring 获取。
引用
@article{arxiv.2011.09393,
title = {Adversarial Turing Patterns from Cellular Automata},
author = {Nurislam Tursynbek and Ilya Vilkoviskiy and Maria Sindeeva and Ivan Oseledets},
journal= {arXiv preprint arXiv:2011.09393},
year = {2021}
}
备注
Published as a conference paper at AAAI 2021 (camera-ready version)