中文

在黑盒学习系统中阻断对抗样本的可迁移性

机器学习 2017-03-14 v1

摘要

机器学习(ML)的进步使其成为许多应用中的核心组成部分,包括银行、医疗诊断和无人驾驶汽车。为进一步拓展 ML 模型的使用,微软、亚马逊、谷歌等公司提供的云端服务已开发出作为黑盒系统的“机器学习即服务”工具。然而,ML 分类器容易受到对抗样本的攻击:经过恶意修改的输入可使分类器输出攻击者期望的结果。此外,已知在一个分类器上生成的对抗样本很可能导致另一个分类器犯同样的错误,即使这两个分类器具有不同的架构或是在不相交的数据集上训练的。这一被称为可迁移性的特性,使得通过在替代分类器上生成对抗样本并将其迁移至目标分类器来攻击黑盒系统成为可能。因此,保护黑盒学习系统免受对抗样本攻击的关键在于阻断其可迁移性。为此,我们提出一种训练方法,使得当输入受到更大扰动时,分类器会平滑地输出对原始标签更低的置信度,并转而预测该输入为“无效”。本质上,我们用一个 NULL 标签扩充了输出类别集合,并训练分类器通过将对抗样本分类为 NULL 来拒绝它们。在实验中,我们对黑盒系统施加了多种基于对抗样本的攻击。我们证明,使用所提方法训练的分类器能有效抵御对抗样本,同时保持对干净数据的准确率。

关键词

引用

@article{arxiv.1703.04318,
  title  = {Blocking Transferability of Adversarial Examples in Black-Box Learning Systems},
  author = {Hossein Hosseini and Yize Chen and Sreeram Kannan and Baosen Zhang and Radha Poovendran},
  journal= {arXiv preprint arXiv:1703.04318},
  year   = {2017}
}