利用对抗训练自编码器净化对抗扰动
机器学习
2019-05-28 v1 密码学与安全
计算机视觉与模式识别
机器学习
摘要
机器学习模型易受对抗样本攻击。迭代对抗训练在抵御强白盒攻击方面已展现出良好前景。然而,对抗训练代价极高,且每次需要保护一个模型时,都需执行这一昂贵的训练方案。本文提出将迭代对抗训练方案应用于一个外部自编码器,该自编码器一经训练便可直用于保护其他模型。我们通过实验表明,我们的模型在白盒攻击下优于其他基于净化的方法,并能很好地迁移以直接保护具有不同架构的其他基模型。
引用
@article{arxiv.1905.10729,
title = {Purifying Adversarial Perturbation with Adversarially Trained Auto-encoders},
author = {Hebi Li and Qi Xiao and Shixin Tian and Jin Tian},
journal= {arXiv preprint arXiv:1905.10729},
year = {2019}
}