IAE:用于情感分析系统的基于反讽的对抗样本
计算与语言
2024-11-13 v1 人工智能
摘要
对抗样本是指经过刻意扰动、引入难以察觉的改变以诱导模型出错的输入,这已引发了对深度神经网络 (DNN) 可靠性和安全性的严重关切。尽管对抗攻击在图像等连续数据领域已被广泛研究,但文本的离散性质带来了独特的挑战。在本文中,我们提出了基于反讽的对抗样本 (IAE),这是一种将直白句子转化为反讽句子以创建对抗文本的方法。该方法利用了反讽这一修辞手法,其真实意图与字面解释相反,需要更深入地理解上下文才能察觉。IAE 方法尤其具有挑战性,因为它需要准确定位评价词,用合适的搭配替换它们,并用恰当的反讽元素扩展文本,同时保持语义连贯性。我们的研究做出了以下关键贡献:(1) 我们引入了 IAE,这是一种利用反讽生成文本对抗样本的策略。该方法不依赖于预先存在的反讽语料库,使其成为在各种 NLP 任务中创建对抗文本的通用工具。(2) 我们证明,当遭受 IAE 攻击时,几个最先进的深度学习模型在情感分析任务上的性能显著下降。这一发现突显了当前 NLP 系统易受通过反讽进行的对抗性操纵的影响。(3) 我们比较了 IAE 对人类判断与 NLP 系统的影响,揭示了人类受文本中反讽影响的程度较低。
引用
@article{arxiv.2411.07850,
title = {IAE: Irony-based Adversarial Examples for Sentiment Analysis Systems},
author = {Xiaoyin Yi and Jiacheng Huang},
journal= {arXiv preprint arXiv:2411.07850},
year = {2024}
}