本福特定律:关于对抗图像它说明了什么?
计算机视觉与模式识别
2024-03-13 v2 人工智能
机器学习
摘要
卷积神经网络(CNNs)对输入图像中的微小扰动十分脆弱。这些网络因此易遭恶意攻击,攻击者扰动输入以迫使误分类。此类旨在欺骗分类器的轻微篡改图像被称为对抗图像。本工作中,我们研究自然图像与对抗图像之间的统计差异。更确切地说,我们表明采用恰当的图像变换,且对于一类对抗攻击,对抗图像中像素首位数字的分布偏离本福特定律。攻击越强,所得分布与本福特定律相距越远。我们的分析对该新方法进行了详细探究,其可作为替代性对抗样本检测方法的基石,此类方法无需修改原始 CNN 分类器,亦不依赖原始高维像素作为特征来防御攻击。
引用
@article{arxiv.2102.04615,
title = {Benford's law: what does it say on adversarial images?},
author = {João G. Zago and Fabio L. Baldissera and Eric A. Antonelo and Rodrigo T. Saad},
journal= {arXiv preprint arXiv:2102.04615},
year = {2024}
}