中文

DARCCC:基于类条件胶囊重构检测对抗样本

机器学习 2018-11-19 v1 密码学与安全 计算机视觉与模式识别 机器学习

摘要

我们提出了一种简单技术,使胶囊模型能够检测对抗图像。除被训练用于分类图像外,胶囊模型还被训练为从正确顶层胶囊的姿态参数和身份重构图像。对抗图像看起来不像预测类别的典型成员,并且当重构由该类的顶层胶囊产生时,它们具有大得多的重构误差。我们表明,对输入图像与来自获胜胶囊的重构之间的 l2l2 距离设定阈值,对于三个不同数据集在检测对抗图像上非常有效。同样的技术对已在 softmax 之前从最后隐藏层的全部或部分训练重构图像的 CNN 也相当有效。随后我们探索了一种更强的、考虑重构误差的白盒攻击。该攻击能够欺骗我们的检测技术,但为了使模型将其预测改变为另一类,攻击通常必须使“对抗”图像类似于另一类的图像。

关键词

引用

@article{arxiv.1811.06969,
  title  = {DARCCC: Detecting Adversaries by Reconstruction from Class Conditional Capsules},
  author = {Nicholas Frosst and Sara Sabour and Geoffrey Hinton},
  journal= {arXiv preprint arXiv:1811.06969},
  year   = {2018}
}

备注

To be presented at NIPS 2018 Workshop on Security in Machine Learning