基于词频引导的词替换用于检测文本对抗样本
计算与语言
2021-01-27 v2
摘要
近期的研究表明,神经文本处理模型易受对抗样本的攻击,但这类样本的本质尚不清楚。在本工作中,我们展示了针对CNN、LSTM和基于Transformer的分类模型的对抗攻击所执行的词替换,可通过被替换词与其对应替换词之间的词频差异来识别。基于这些发现,我们提出了词频引导的词替换(FGWS),一种利用对抗词替换的频率特性来检测对抗样本的简易算法。FGWS在SST-2和IMDb情感数据集上通过准确检测对抗样本取得了强劲性能,针对基于RoBERTa的分类模型的F1检测分数高达91.4%。我们将我们的方法与近期提出的扰动判别框架进行比较,结果显示我们的F1分数高出其最多13.0%。
引用
@article{arxiv.2004.05887,
title = {Frequency-Guided Word Substitutions for Detecting Textual Adversarial Examples},
author = {Maximilian Mozes and Pontus Stenetorp and Bennett Kleinberg and Lewis D. Griffin},
journal= {arXiv preprint arXiv:2004.05887},
year = {2021}
}
备注
EACL 2021 camera-ready