重新评估自然语言中的对抗样本
计算与语言
2021-12-23 v3 人工智能
密码学与安全
机器学习
摘要
针对 NLP 模型的最先进攻击缺乏关于什么是成功攻击的统一定义。我们将过去工作的思想提炼为一个统一框架:一个成功的自然语言对抗样本是一种欺骗模型并遵循某些语言约束的扰动。然后我们分析了两种最先进同义词替换攻击的输出。我们发现它们的扰动常常不能保持语义,且 38% 引入了语法错误。人类调查表明,要成功保持语义,我们需要显著提高被替换词嵌入之间以及原句与扰动句编码之间的最小余弦相似度。在调整约束以更好地保持语义和语法性后,攻击成功率下降了超过 70 个百分点。
引用
@article{arxiv.2004.14174,
title = {Reevaluating Adversarial Examples in Natural Language},
author = {John X. Morris and Eli Lifland and Jack Lanchantin and Yangfeng Ji and Yanjun Qi},
journal= {arXiv preprint arXiv:2004.14174},
year = {2021}
}
备注
15 pages; 9 Tables; 5 Figures