中文

BOSS:对抗样本的双向一次性合成

机器学习 2022-07-19 v2

摘要

设计对深度分类器输入的可加性不可感知扰动以最大化其误分类率,是对抗机器学习的核心焦点。另一种方法是利用类 GAN 结构从零合成对抗样本,尽管需要使用大量训练数据。相比之下,本文考虑对抗样本的一次性合成;这些输入从零合成,以在预训练模型输出处诱导任意软预测,同时保持与指定输入的高度相似性。为此,我们提出了一个问题,其对训练模型期望分布与输出分布之间的距离以及此类输入与合成样本之间的相似性进行了目标编码。我们证明所表述的问题是 NP 完全的。随后,我们推进了一种生成式求解方法,其中对抗样本作为一个生成网络的输出获得,该网络的参数通过为双目标优化替代损失函数而迭代更新。我们通过应用于定向对抗攻击的设计、决策边界样本的生成以及低置信度分类输入的合成,证明了所提框架与方法的通用性和灵活性。该方法进一步扩展到具有不同软输出规范的模型集成。实验结果验证了所开发的定向与置信度降低攻击方法与最先进算法性能相当。

关键词

引用

@article{arxiv.2108.02756,
  title  = {BOSS: Bidirectional One-Shot Synthesis of Adversarial Examples},
  author = {Ismail R. Alkhouri and Alvaro Velasquez and George K. Atia},
  journal= {arXiv preprint arXiv:2108.02756},
  year   = {2022}
}