学习解耦鲁棒与脆弱特征用于对抗检测
机器学习
2019-09-11 v1 机器学习
摘要
尽管深度神经网络在各种任务上展现出良好性能,甚至在某些任务上达到人类水平,但研究表明即使对输入施加难以察觉的微小扰动,它们也易出现错误预测。已有大量工作提出通过鲁棒推断或对抗输入检测来防御此类对抗攻击。然而,多数方法无法有效防御白盒攻击(攻击方知晓模型与防御)。更重要的是,它们未给出对抗输入成功欺骗目标模型的令人信服的原因。为解决现有方法的这些不足,我们假设对抗输入与易受对抗扰动影响的潜在特征相关,称之为脆弱特征。基于该直觉,我们提出极小极大博弈公式,利用具有两个潜空间的变分自编码器将每个实例的潜在特征解耦为鲁棒与脆弱两类。我们在MNIST、Fashion MNIST5和Cat & Dog数据集上针对黑盒与白盒攻击充分验证模型,结果表明对抗输入若不改变语义则无法绕过我们的检测器,此时攻击即告失败。
引用
@article{arxiv.1909.04311,
title = {Learning to Disentangle Robust and Vulnerable Features for Adversarial Detection},
author = {Byunggill Joe and Sung Ju Hwang and Insik Shin},
journal= {arXiv preprint arXiv:1909.04311},
year = {2019}
}
备注
main: 10 pages appendix: 5 pages