人类如何感知对抗文本?对基于词的对抗攻击有效性与自然性的现实检验
计算与语言
2023-05-26 v1 人工智能
摘要
基于机器学习(ML)的自然语言处理(NLP)模型易受对抗攻击——即微妙修改输入文本以迫使模型做出错误预测的恶意算法。然而,对这些攻击的评估忽视了不可感知性这一属性,或在有限设定下研究它。这意味着对抗扰动无法通过任何人工质量把关,且不代表对有人工核查的 NLP 系统的真实威胁。为绕过此限制并实现对 NLP 模型鲁棒性的恰当评估(及后续改进),我们调查了 378 名人类参与者,询问其对最先进方法生成的文本对抗样本的感知度。我们的结果强调,现有文本攻击在涉及人类的真实场景中不切实际。这与先前小规模人类研究报告的过于乐观的攻击成功结论形成对比。通过我们的工作,我们希望将人类感知度定位为文本攻击的一等成功标准,并为研究构建有效攻击算法进而设计适当防御机制提供指导。
引用
@article{arxiv.2305.15587,
title = {How do humans perceive adversarial text? A reality check on the validity and naturalness of word-based adversarial attacks},
author = {Salijona Dyrmishi and Salah Ghamizi and Maxime Cordy},
journal= {arXiv preprint arXiv:2305.15587},
year = {2023}
}
备注
ACL 2023