中文

基于解耦表示的自监督对抗样本检测

计算机视觉与模式识别 2022-08-30 v4 密码学与安全 机器学习

摘要

深度学习模型已知易受精心设计的恶意对抗样本攻击,且这些样本对人感知系统不可察觉。自编码器若仅在良性样本上训练,已广泛基于“对抗样本产生更大重建误差”的假设用于(自监督)对抗检测。然而,由于训练缺乏对抗样本且自编码器泛化能力过强,该假设在实践中并非总成立。为缓解此问题,我们探索如何在自编码器结构下利用解耦的标签/语义特征检测对抗样本。具体而言,我们提出基于解耦表示的重建(DRR)。在 DRR 中,我们在正确配对与错误配对的标签/语义特征上训练自编码器以重建良性样本与反例。这模拟了对抗样本的行为并降低了自编码器不必要的泛化能力。我们在不同对抗攻击与不同受害模型下将方法与最先进的自监督检测方法比较,其在多数攻击设定下于各类指标(ROC 曲线下面积、真正率、真负率)表现更优。尽管 DRR 初为视觉任务设计,我们展示其亦可轻松扩展至自然语言任务。值得注意的是,不同于其他基于自编码器的检测器,我们的方法可对自适应对手提供抵抗能力。

关键词

引用

@article{arxiv.2105.03689,
  title  = {Self-Supervised Adversarial Example Detection by Disentangled Representation},
  author = {Zhaoxi Zhang and Leo Yu Zhang and Xufei Zheng and Jinyu Tian and Jiantao Zhou},
  journal= {arXiv preprint arXiv:2105.03689},
  year   = {2022}
}

备注

to appear in TrustCom 2022