中文

面向深度神经网络轻量级黑盒攻击的研究

机器学习 2022-10-12 v3 密码学与安全

摘要

黑盒攻击可在不访问目标模型参数的情况下生成对抗样本,极大加剧了已部署深度神经网络(DNNs)的威胁。然而,先前工作指出,当训练数据和输出均不可访问时,黑盒攻击无法误导目标模型。本工作中,我们主张在这种仅有少量测试样本可用的极度受限场景下,黑盒攻击仍能构成实际攻击。具体而言,我们发现对基于少量测试样本训练的DNN浅层进行攻击可生成强大的对抗样本。由于仅需少量样本,我们称这些攻击为轻量级黑盒攻击。推动轻量级攻击的主要挑战是缓解浅层近似误差带来的不利影响。由于可用样本极少难以缓解近似误差,我们提出用于轻量级攻击的Error TransFormer(ETF)。即,ETF将参数空间中的近似误差转化为特征空间中的扰动,并通过扰动特征来缓解误差。实验中,采用所提ETF的轻量级黑盒攻击取得了惊人结果。例如,即便每类仅1个样本可用,轻量级黑盒攻击的成功率仅比具有完整训练数据的黑盒攻击低约3%。

关键词

引用

@article{arxiv.2209.14826,
  title  = {Towards Lightweight Black-Box Attacks against Deep Neural Networks},
  author = {Chenghao Sun and Yonggang Zhang and Wan Chaoqun and Qizhou Wang and Ya Li and Tongliang Liu and Bo Han and Xinmei Tian},
  journal= {arXiv preprint arXiv:2209.14826},
  year   = {2022}
}