中文

揭示自注意力机制的脆弱性

计算与语言 2024-02-27 v1

摘要

预训练语言模型(PLMs)被证明对微小的词汇变化非常脆弱,这对现实世界的系统构成了巨大威胁。虽然以往的研究直接关注于操纵词汇输入,但它们生成对抗样本的方法有限,缺乏对多样化现实世界攻击的泛化能力。本文研究了基于Transformer的PLMs的基本结构——自注意力(SA)机制。(1) 我们提出了一种强大的扰动技术\textit{HackAttend},该技术通过精心设计的注意力掩码来扰动SA矩阵内的注意力分数。我们表明,最先进的PLMs存在严重的脆弱性,微小的注意力扰动(1%)(1\%)即可产生非常高的攻击成功率(98%)(98\%)。我们的论文将传统的词汇扰动文本攻击扩展到了更一般的结构扰动。(2) 我们引入了\textit{S-Attend},一种新颖的平滑技术,通过结构扰动有效地使SA变得鲁棒。我们通过实验证明,这种简单而有效的技术在面对各种文本攻击者时,能够达到与对抗训练相当的鲁棒性能。代码公开在 \url{github.com/liongkj/HackAttend}。

关键词

引用

@article{arxiv.2402.16470,
  title  = {Unveiling Vulnerability of Self-Attention},
  author = {Khai Jiet Liong and Hongqiu Wu and Hai Zhao},
  journal= {arXiv preprint arXiv:2402.16470},
  year   = {2024}
}

备注

https://github.com/liongkj/HackAttend