通过投影 Sinkhorn 迭代的 Wasserstein 对抗样本
机器学习
2020-01-22 v2 机器学习
摘要
研究对抗样本(即被扰动以欺骗分类器的数据点)存在性的工作正迅速增长,但绝大多数此类工作主要关注由 范数有界扰动定义的威胁模型。本文中,我们提出一种基于 Wasserstein 距离的对抗攻击新威胁模型。在图像分类设定下,此类距离度量移动像素质量的代价,其天然涵盖“标准”图像操作如缩放、旋转、平移与畸变(并且也可能应用于其他设定)。为生成 Wasserstein 对抗样本,我们基于改进版 Sinkhorn 迭代,开发了投影到 Wasserstein 球上的过程。所得算法可成功攻击图像分类模型,在半径为 0.1 的 Wasserstein 球内(即移动 10% 的图像质量 1 个像素)将传统 CIFAR10 模型准确率降至 3%,并且我们证明基于 PGD 的对抗训练可将该对抗准确率提升至 76%。总体而言,本工作开启了对抗鲁棒性研究的新方向,更形式化地考虑能准确刻画我们通常认为分类器应具备的不变性的凸度量。论文中所有实验的代码可在 https://github.com/locuslab/projected_sinkhorn 获取。
引用
@article{arxiv.1902.07906,
title = {Wasserstein Adversarial Examples via Projected Sinkhorn Iterations},
author = {Eric Wong and Frank R. Schmidt and J. Zico Kolter},
journal= {arXiv preprint arXiv:1902.07906},
year = {2020}
}