中文

面向高效无数据对抗检测的通用对抗扰动研究

计算与语言 2023-06-29 v1 机器学习

摘要

检测被精心构造以欺骗模型的对抗样本是社会安全应用的关键步骤。然而,现有对抗检测方法需要访问充足的训练数据,这引发了关于隐私泄露与泛化性的显著担忧。本工作中,我们验证了攻击算法生成的对抗样本与高维输入中的特定向量强相关。此类向量,即 UAP(通用对抗扰动,Universal Adversarial Perturbations),可在无原始训练数据的情况下计算。基于该发现,我们提出了一种数据无关的对对抗检测框架,其诱导正常样本与对抗样本对 UAP 的不同响应。实验结果表明,我们的方法在多种文本分类任务上取得了有竞争力的检测性能,并保持与正常推理相当的时间消耗。

关键词

引用

@article{arxiv.2306.15705,
  title  = {On the Universal Adversarial Perturbations for Efficient Data-free Adversarial Detection},
  author = {Songyang Gao and Shihan Dou and Qi Zhang and Xuanjing Huang and Jin Ma and Ying Shan},
  journal= {arXiv preprint arXiv:2306.15705},
  year   = {2023}
}

备注

Accepted by ACL2023 (Short Paper)