揭示自注意力机制的脆弱性
计算与语言
2024-02-27 v1
摘要
预训练语言模型(PLMs)被证明对微小的词汇变化非常脆弱,这对现实世界的系统构成了巨大威胁。虽然以往的研究直接关注于操纵词汇输入,但它们生成对抗样本的方法有限,缺乏对多样化现实世界攻击的泛化能力。本文研究了基于Transformer的PLMs的基本结构——自注意力(SA)机制。(1) 我们提出了一种强大的扰动技术\textit{HackAttend},该技术通过精心设计的注意力掩码来扰动SA矩阵内的注意力分数。我们表明,最先进的PLMs存在严重的脆弱性,微小的注意力扰动即可产生非常高的攻击成功率。我们的论文将传统的词汇扰动文本攻击扩展到了更一般的结构扰动。(2) 我们引入了\textit{S-Attend},一种新颖的平滑技术,通过结构扰动有效地使SA变得鲁棒。我们通过实验证明,这种简单而有效的技术在面对各种文本攻击者时,能够达到与对抗训练相当的鲁棒性能。代码公开在 \url{github.com/liongkj/HackAttend}。
引用
@article{arxiv.2402.16470,
title = {Unveiling Vulnerability of Self-Attention},
author = {Khai Jiet Liong and Hongqiu Wu and Hai Zhao},
journal= {arXiv preprint arXiv:2402.16470},
year = {2024}
}
备注
https://github.com/liongkj/HackAttend