中文

用于对抗性黑箱攻击的强化学习平台

机器学习 2025-04-16 v2 人工智能 密码学与安全 计算机视觉与模式识别

摘要

我们提出了一个用于对抗性黑箱攻击的强化学习平台RLAB,支持针对非针对性和针对性攻击的生成,对抗样本。该平台允许用户从多种畸变滤波器中进行选择,以创建对抗性示例。平台使用强化学习智能体在添加最小畸变的同时仍会导致目标模型对输入图像进行误分类。智能体采用一种新颖的双动作方法,在每一步探索输入图像,以识别添加畸变的敏感区域,同时移除对目标模型影响较小的噪声。这种双重动作导致攻击的快速且更高效的收敛。该平台还可用于衡量图像分类模型针对特定畸变类型的鲁棒性。此外,使用对抗样本进行模型再训练显著提高了在基准数据集上的鲁棒性。该提议平台在引起误分类所需的平均查询次数方面优于最先进的方法。这一工作在提高可信度方面具有积极的社会影响。

关键词

引用

@article{arxiv.2501.14122,
  title  = {Reinforcement Learning Platform for Adversarial Black-box Attacks with Custom Distortion Filters},
  author = {Soumyendu Sarkar and Ashwin Ramesh Babu and Sajad Mousavi and Vineet Gundecha and Sahand Ghorbanpour and Avisek Naug and Ricardo Luna Gutierrez and Antonio Guillen},
  journal= {arXiv preprint arXiv:2501.14122},
  year   = {2025}
}

备注

Accepted at the 2025 AAAI Conference on Artificial Intelligence Proceedings