中文

BERT-Defense:基于BERT的概率模型抵御认知启发的拼写对抗攻击

计算与语言 2021-06-04 v1 机器学习

摘要

对抗攻击暴露了深度学习系统的重要盲点。虽然词级和句子级攻击场景主要处理寻找愚弄NLP模型的输入语义改写,但字符级攻击通常向输入流中插入拼写错误。通常认为这些更容易通过拼写纠正模块防御。在这项工作中,我们表明标准拼写检查器以及Pruthi等人(2019)的方法(其训练以防御插入、删除和交换)在Eger和Benz(2020)最近提出的字符级基准上表现不佳,该基准包含更具挑战性的攻击,如视觉和语音扰动以及缺失词分割。相反,我们表明一种未训练的迭代方法,将上下文无关的字符级信息与来自BERT掩码语言建模的上下文相关信息结合,可以与通过3-shot学习监督的Amazon Mechanical Turk(AMT)人类众包工作者表现相当。

关键词

引用

@article{arxiv.2106.01452,
  title  = {BERT-Defense: A Probabilistic Model Based on BERT to Combat Cognitively Inspired Orthographic Adversarial Attacks},
  author = {Yannik Keller and Jan Mackensen and Steffen Eger},
  journal= {arXiv preprint arXiv:2106.01452},
  year   = {2021}
}

备注

Findings of ACL 2021