中文

生成自然对抗样本

机器学习 2018-02-27 v2 人工智能 计算与语言 计算机视觉与模式识别

摘要

由于其复杂性,很难刻画机器学习模型在部署时出错或被利用的方式。近期关于对抗样本(即经微小扰动导致模型预测显著不同的输入)的工作,通过暴露模型失效的对抗场景,有助于评估这些模型的鲁棒性。然而,这些恶意扰动往往不自然、无语义意义,且不适用于语言等复杂领域。本文中,我们提出一个框架,通过在与密集连续数据表示的语义空间中搜索,并利用生成对抗网络(GAN)的近期进展,来生成位于数据流形上的自然且易读的对抗样本。我们展示所生成的对抗样本,以证明该方法在图像分类、文本蕴含与机器翻译等广泛应用中对黑盒分类器的潜力。我们包含实验以表明所生成的对抗样本是自然、人类可读的,且有助于评估与分析黑盒分类器。

关键词

引用

@article{arxiv.1710.11342,
  title  = {Generating Natural Adversarial Examples},
  author = {Zhengli Zhao and Dheeru Dua and Sameer Singh},
  journal= {arXiv preprint arXiv:1710.11342},
  year   = {2018}
}

备注

Published as a conference paper at the International Conference on Learning Representations (ICLR) 2018