用于对抗检测的输入特定注意力子网络
计算与语言
2022-03-24 v1 密码学与安全
机器学习
摘要
自注意力头是 Transformer 模型的特征,并已在可解释性与剪枝方面被充分研究。本工作中,我们展示了注意力头一种完全不同的用途,即用于对抗检测。具体而言,我们提出一种从其中构建输入特定注意力子网络(IAS)的方法,并从中提取三个特征以区分真实输入与对抗输入。所得检测器在 10 个 NLU 数据集、11 种不同对抗攻击类型上,将 BERT 编码器的业界最优对抗检测准确率显著提升(超过 7.5%)。我们还证明,我们的方法(a)对更大的模型更准确,此类模型可能有更多伪相关因而易受对抗攻击;(b)即便在规模中等的对抗样本训练集下也表现良好。
引用
@article{arxiv.2203.12298,
title = {Input-specific Attention Subnetworks for Adversarial Detection},
author = {Emil Biju and Anirudh Sriram and Pratyush Kumar and Mitesh M Khapra},
journal= {arXiv preprint arXiv:2203.12298},
year = {2022}
}
备注
Accepted at Findings of ACL 2022, 14 pages, 6 Tables and 9 Figures