中文

学习分离对抗表示簇以实现鲁棒对抗检测

机器学习 2020-12-08 v1 人工智能 密码学与安全

摘要

尽管深度神经网络在各任务上展现出良好性能,其仍易因输入中难以察觉的微小扰动而产生错误预测。大量已有工作提出检测对抗攻击,然而多数无法有效抵御自适应白盒攻击——即攻击方知晓模型与防御方法。本文受近期引入的非鲁棒特征启发,提出一种新概率对抗检测器。我们将非鲁棒特征视为对抗样本的共同属性,并推断可在表示空间中找到对应此属性的簇。该思路引导我们对独立簇中对抗表示的概率分布进行估计,并利用该分布构建基于似然的对抗检测器。

关键词

引用

@article{arxiv.2012.03483,
  title  = {Learning to Separate Clusters of Adversarial Representations for Robust Adversarial Detection},
  author = {Byunggill Joe and Jihun Hamm and Sung Ju Hwang and Sooel Son and Insik Shin},
  journal= {arXiv preprint arXiv:2012.03483},
  year   = {2020}
}