成为你自己的邻域:基于自监督学习构建邻域关系检测对抗样本
机器学习
2022-09-02 v1 密码学与安全
摘要
深度神经网络(DNN)已在多个领域取得优异性能。然而,DNN 对对抗样本(AE)的脆弱性阻碍了其向安全关键型应用的部署。本文提出一种新颖的 AE 检测框架,名为 BEYOND,用于可信预测。BEYOND 通过区分 AE 与其增强版本(即邻居)之间的异常关系进行检测,从两个角度入手:表示相似性与标签一致性。相较于监督学习模型,现成的自监督学习(SSL)模型因其高度信息化的表示能力而被用于提取表示并预测标签。对于干净样本,其表示与预测与邻居紧密一致,而 AE 的则表示与预测差异显著。此外,我们解释了该现象,并表明利用此差异 BEYOND 可有效检测 AE。我们为 BEYOND 的有效性提供了严格论证。进一步地,作为即插即用模型,BEYOND 可轻松与对抗训练分类器(ATC)协作,达到最先进(SOTA)的鲁棒准确率。实验结果表明,BEYOND 大幅优于基线方法,尤其在自适应攻击下。得益于基于 SSL 构建的鲁棒关系网络,我们发现 BEYOND 在检测能力与速度上均优于基线。我们的代码将公开可用。
引用
@article{arxiv.2209.00005,
title = {Be Your Own Neighborhood: Detecting Adversarial Example by the Neighborhood Relations Built on Self-Supervised Learning},
author = {Zhiyuan He and Yijun Yang and Pin-Yu Chen and Qiang Xu and Tsung-Yi Ho},
journal= {arXiv preprint arXiv:2209.00005},
year = {2022}
}
备注
co-first author