中文

用于对抗检测的输入特定注意力子网络

计算与语言 2022-03-24 v1 密码学与安全 机器学习

摘要

自注意力头是 Transformer 模型的特征,并已在可解释性与剪枝方面被充分研究。本工作中,我们展示了注意力头一种完全不同的用途,即用于对抗检测。具体而言,我们提出一种从其中构建输入特定注意力子网络(IAS)的方法,并从中提取三个特征以区分真实输入与对抗输入。所得检测器在 10 个 NLU 数据集、11 种不同对抗攻击类型上,将 BERT 编码器的业界最优对抗检测准确率显著提升(超过 7.5%)。我们还证明,我们的方法(a)对更大的模型更准确,此类模型可能有更多伪相关因而易受对抗攻击;(b)即便在规模中等的对抗样本训练集下也表现良好。

关键词

引用

@article{arxiv.2203.12298,
  title  = {Input-specific Attention Subnetworks for Adversarial Detection},
  author = {Emil Biju and Anirudh Sriram and Pratyush Kumar and Mitesh M Khapra},
  journal= {arXiv preprint arXiv:2203.12298},
  year   = {2022}
}

备注

Accepted at Findings of ACL 2022, 14 pages, 6 Tables and 9 Figures