中文

基于多任务学习的可扩展对抗攻击溯源

机器学习 2023-03-01 v1 人工智能 密码学与安全

摘要

深度神经网络(DNNs)在推理阶段容易被对抗攻击欺骗,攻击者在原始样本上添加难以察觉的扰动即对抗样本。许多工作聚焦于对抗检测和对抗训练以防御对抗攻击。然而,极少有工作探索对抗样本背后的工具链,而这可帮助防御者掌握攻击发起者的线索、其目标,并洞悉针对相应攻击最有效的防御算法。鉴于此缺口,有必要开发能够识别用于生成对抗样本的工具链的技术,称为对抗溯源问题(AAP)。本文将AAP定义为对三种签名(即攻击算法、受害模型和超参数)的识别。现有工作将AAP转化为单标签分类任务,忽略了这些签名之间的关系。前者会随着签名数量增加而遭遇组合爆炸问题;后者意味着我们不能将AAP简单视为单任务问题。我们首先开展实验验证对抗样本的可溯源性。此外,我们提出名为多任务对抗溯源(MTAA)的多任务学习框架,同时识别三种签名。MTAA包含扰动提取模块、对抗专用提取模块以及分类与回归模块。它考虑了攻击算法与相应超参数之间的关系,并使用不确定性加权损失来调整三个识别任务的权重。在MNIST和ImageNet上的实验结果表明了所提框架的可行性与可扩展性,以及其在处理误报方面的有效性。

关键词

引用

@article{arxiv.2302.14059,
  title  = {Scalable Attribution of Adversarial Attacks via Multi-Task Learning},
  author = {Zhongyi Guo and Keji Han and Yao Ge and Wei Ji and Yun Li},
  journal= {arXiv preprint arXiv:2302.14059},
  year   = {2023}
}