文本分类神经网络的对抗重编程
机器学习
2019-08-16 v4 密码学与安全
机器学习
摘要
对抗重编程已证明能够利用预训练神经网络分类器完成替代分类任务,而无需修改原始网络。在此类攻击场景中,攻击者对输入训练一个加性贡献,以将神经网络重新用于新的分类任务。尽管这种重编程方法适用于具有连续输入空间(如图像)的神经网络,但它不能直接应用于为文本分类等任务训练的神经网络,因为后者的输入空间是离散的。重新利用此类分类网络将要求攻击者学习一个将输入从一个离散空间映射到另一个离散空间的对抗程序。在这项工作中,我们引入一种基于上下文的词表重映射模型,将训练于特定序列分类任务的神经网络重编程为对抗者所期望的新序列分类任务。我们提出了在白盒与黑盒设置下训练该对抗程序的方法。我们通过将多种文本分类模型(包括LSTM、双向LSTM和CNN)对抗重编程用于替代分类任务,展示了我们模型的应用。
引用
@article{arxiv.1809.01829,
title = {Adversarial Reprogramming of Text Classification Neural Networks},
author = {Paarth Neekhara and Shehzeen Hussain and Shlomo Dubnov and Farinaz Koushanfar},
journal= {arXiv preprint arXiv:1809.01829},
year = {2019}
}
备注
Published as a conference paper at EMNLP 2019