BAE:基于 BERT 的面向文本分类的对抗样本生成方法
计算与语言
2022-06-22 v3
摘要
现代文本分类模型易受对抗样本的影响,对抗样本是原始文本的扰动版本,人类难以察觉,但会被模型误分类。NLP 近期工作使用基于规则的同义词替换策略生成对抗样本。这些策略可能导致脱离上下文且不自然的复杂词元替换,易被人类识别。我们提出 BAE,一种利用 BERT 掩码语言模型通过上下文扰动生成对抗样本的黑盒攻击方法。BAE 通过掩码部分文本并利用 BERT-MLM 为被掩码词元生成替代项,从而在原始文本中替换和插入词元。通过自动与人工评估,我们表明 BAE 实施了更强的攻击,并且与先前工作相比,生成的对抗样本具有更好的语法性与语义连贯性。
引用
@article{arxiv.2004.01970,
title = {BAE: BERT-based Adversarial Examples for Text Classification},
author = {Siddhant Garg and Goutham Ramakrishnan},
journal= {arXiv preprint arXiv:2004.01970},
year = {2022}
}
备注
Accepted at EMNLP 2020 Main Conference