学习混淆:利用自编码器生成训练时对抗数据
机器学习
2019-05-23 v1 机器学习
摘要
在本工作中,我们考虑一种具有挑战性的训练时攻击,通过对训练数据施加有界扰动进行修改,期望在测试时面对干净样本时操纵任何相应训练分类器的行为(目标或非目标)。为此,我们提出使用类自编码器的网络为训练数据生成扰动,并配上一个可微系统充当假想受害分类器。扰动生成器将通过观察假想分类器的训练过程来学习更新其权重,以产生最具危害性且不易察觉的噪声,进而使受害分类器的泛化能力最低。这可表述为一个非线性等式约束优化问题。与GAN不同,求解此类问题在计算上具有挑战性,我们随后提出一种简单而有效的步骤,对两个网络的交替更新进行解耦以稳定训练。本文提出的方法可轻松扩展到标签特定设定,即攻击者可根据某些预定义规则操纵受害分类器的预测,而非仅制造错误预测。在包括CIFAR-10和精简版ImageNet在内的多个数据集上的实验证实了所提方法的有效性,经验结果表明,此类有界扰动具有良好的可迁移性,无论受害方在图像数据上实际使用何种分类器。
引用
@article{arxiv.1905.09027,
title = {Learning to Confuse: Generating Training Time Adversarial Data with Auto-Encoder},
author = {Ji Feng and Qi-Zhi Cai and Zhi-Hua Zhou},
journal= {arXiv preprint arXiv:1905.09027},
year = {2019}
}