深度心智所见略同?面向多深度神经网络精细操控的选择性对抗攻击
计算机视觉与模式识别
2020-03-27 v1 机器学习
图像与视频处理
最优化与控制
机器学习
摘要
近期工作已证明存在针对单一机器学习系统的{\it 对抗样本}。本文中我们提出一个简单但根本的问题——“选择性愚弄”:给定被分配解决同一分类问题且接收相同输入信号的{\it 多个}机器学习系统,是否可能构造对该输入信号的扰动,以任意预定义方式{\it 同时}操控这些{\it 多个}机器学习系统的输出?例如,是否可能选择性地愚弄一组“敌方”机器学习系统而不愚弄其他“友方”机器学习系统?该问题的答案取决于这些不同机器学习系统“所见略同”的程度。我们将“选择性愚弄”问题表述为一类新颖的优化问题,并报告在 MNIST 数据集上的一系列实验。这些实验的初步发现表明,事实上非常容易同时选择性操控多个 MNIST 分类器,即便这些分类器在架构、训练算法与训练数据集上完全相同,仅训练中的随机初始化不同。这意味着两个名义上等价的机器学习系统实际上根本不“所见略同”,并为诸多新颖应用与对深度神经网络工作原理的更深理解开辟了可能。
引用
@article{arxiv.2003.11816,
title = {Do Deep Minds Think Alike? Selective Adversarial Attacks for Fine-Grained Manipulation of Multiple Deep Neural Networks},
author = {Zain Khan and Jirong Yi and Raghu Mudumbai and Xiaodong Wu and Weiyu Xu},
journal= {arXiv preprint arXiv:2003.11816},
year = {2020}
}
备注
9 pages, submitted to ICML 2020