二阶NLP对抗样本
计算与语言
2020-10-07 v2
摘要
NLP中的对抗样本生成方法依赖语言模型或句子编码器等模型来判断候选对抗样本是否有效。在这些方法中,一个有效的对抗样本能欺骗被攻击的模型,并由第二个模型判定其在语义或句法上有效。迄今为止的研究将所有此类样本都视为被攻击模型的错误。我们认为这些对抗样本可能并非被攻击模型的缺陷,而是判定有效性的模型的缺陷。我们将此类无效输入称为二阶对抗样本。我们提出约束鲁棒性曲线及相关的度量ACCS,作为评估约束对二阶对抗样本鲁棒性的工具。为生成该曲线,我们设计了一种直接针对语义相似度模型的对抗攻击。我们在两个约束上进行了测试:Universal Sentence Encoder (USE) 和 BERTScore。我们的发现表明此类二阶样本确实存在,但在最先进的模型中通常比一阶对抗样本更少见。它们还表明USE作为NLP对抗样本的约束是有效的,而BERTScore几乎无效。本文实验代码见 https://github.com/jxmorris12/second-order-adversarial-examples。
引用
@article{arxiv.2010.01770,
title = {Second-Order NLP Adversarial Examples},
author = {John X. Morris},
journal= {arXiv preprint arXiv:2010.01770},
year = {2020}
}
备注
8 pages