基于无梯度搜索的对象识别模型分布内对抗攻击
计算机视觉与模式识别
2025-02-03 v3 机器学习
摘要
神经网络易受二维旋转与平移、图像裁剪乃至对象颜色变化等微小扰动的影响。过往工作将这些错误归因于数据集偏差,声称模型在这些扰动样本上失败是因为它们不属于训练数据分布。在此,我们挑战该论断,并呈现训练数据分布内广泛存在网络无法分类的扰动图像的证据。我们在参数分布采样的数据上训练模型,随后在该数据分布内搜索以发现此类分布内对抗样本。这通过我们基于无梯度进化策略(ES)的方法实现,称之为 CMA-Search。尽管使用了一个包含相机与光照变化的大规模(50 万图像)无偏数据集训练,CMA-Search 仍能通过扰动相机位置在超过 71% 的案例中找到分布内的失败样本。在光照变化下,CMA-Search 在 42% 的案例中找到了误分类。这些发现也延伸至来自 ImageNet 与 Co3D 数据集的自然图像。这种分布内图像现象为人工智能提出了一个令人高度担忧的问题——它们绕过了恶意代理添加工程化噪声以引发对抗攻击的需求。所有代码、数据集与演示均可在 https://github.com/Spandan-Madan/in_distribution_adversarial_examples 获取。
引用
@article{arxiv.2106.16198,
title = {In-distribution adversarial attacks on object recognition models using gradient-free search},
author = {Spandan Madan and Tomotake Sasaki and Hanspeter Pfister and Tzu-Mao Li and Xavier Boix},
journal= {arXiv preprint arXiv:2106.16198},
year = {2025}
}