学习分离对抗表示簇以实现鲁棒对抗检测
机器学习
2020-12-08 v1 人工智能
密码学与安全
摘要
尽管深度神经网络在各任务上展现出良好性能,其仍易因输入中难以察觉的微小扰动而产生错误预测。大量已有工作提出检测对抗攻击,然而多数无法有效抵御自适应白盒攻击——即攻击方知晓模型与防御方法。本文受近期引入的非鲁棒特征启发,提出一种新概率对抗检测器。我们将非鲁棒特征视为对抗样本的共同属性,并推断可在表示空间中找到对应此属性的簇。该思路引导我们对独立簇中对抗表示的概率分布进行估计,并利用该分布构建基于似然的对抗检测器。
引用
@article{arxiv.2012.03483,
title = {Learning to Separate Clusters of Adversarial Representations for Robust Adversarial Detection},
author = {Byunggill Joe and Jihun Hamm and Sung Ju Hwang and Sooel Son and Insik Shin},
journal= {arXiv preprint arXiv:2012.03483},
year = {2020}
}