中文

利用对抗攻击破坏图像与文本分类算法

密码学与安全 2024-11-08 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

机器学习模型容易受到对抗攻击,其中输入可以被操纵以导致错误分类。虽然以前的研究集中在生成对抗网络(GANs)等技术上,但在文本和图像分类模型中利用 GANs 和合成少数类过采样技术(SMOTE)来执行对抗攻击的探索仍然有限。我们的研究通过训练各种机器学习模型并使用 GANs 和 SMOTE 生成额外的数据点来攻击文本分类模型,从而填补了这一空白。此外,我们将研究扩展到人脸识别模型,训练了一个卷积神经网络(CNN),并利用 GradCAM 识别的关键特征对其进行快速梯度符号扰动对抗攻击,GradCAM 是一种用于突出 CNN 在分类中使用的关键图像特征的技术。我们的实验揭示了分类模型中的一个显著漏洞。具体而言,我们观察到攻击后表现最佳的文本分类模型的准确率下降了 20%,同时人脸识别准确率下降了 30%。这凸显了这些模型对输入数据操纵的易感性。对抗攻击不仅损害安全性,还破坏了机器学习系统的可靠性。通过展示对抗攻击对文本分类和人脸识别模型的影响,我们的研究强调了迫切需要开发针对此类漏洞的鲁棒防御。

关键词

引用

@article{arxiv.2411.03348,
  title  = {Undermining Image and Text Classification Algorithms Using Adversarial Attacks},
  author = {Langalibalele Lunga and Suhas Sreehari},
  journal= {arXiv preprint arXiv:2411.03348},
  year   = {2024}
}

备注

Accepted for presentation at Electronic Imaging Conference 2025