对抗球面
计算机视觉与模式识别
2018-09-11 v3
摘要
最先进的计算机视觉模型已被证明对输入的小对抗扰动是脆弱的。换句话说,数据分布中的大多数图像既能被模型正确分类,又非常接近一个视觉上相似但被误分类的图像。尽管有大量的研究兴趣,这一现象的成因仍知之甚少且尚未解决。我们假设这种反直觉的行为是数据流形高维几何的自然结果。作为探索该假设的第一步,我们研究了一个简单的合成数据集,用于区分两个同心高维球面。对于该数据集,我们展示了测试误差量与到最近误差的平均距离之间的基本权衡。特别地,我们证明任何将球面的一个小常数比例误分类的模型都将对大小为 的对抗扰动是脆弱的。令人惊讶的是,当我们在该数据集上训练几种不同架构时,它们所有的误差集都自然接近这一理论界。作为该理论的结果,神经网络对小对抗扰动的脆弱性是观测到的测试误差量的逻辑后果。我们希望对这一非常简单情形的理论分析能为探索复杂真实世界数据集的几何如何导致对抗样本指明前进方向。
引用
@article{arxiv.1801.02774,
title = {Adversarial Spheres},
author = {Justin Gilmer and Luke Metz and Fartash Faghri and Samuel S. Schoenholz and Maithra Raghu and Martin Wattenberg and Ian Goodfellow},
journal= {arXiv preprint arXiv:1801.02774},
year = {2018}
}