Emoti-Attack:通过 Emoji 序列对 NLP 系统发起零扰动对抗攻击
人工智能
2025-02-25 v1 计算与语言
密码学与安全
摘要
深度神经网络 (DNNs) 在自然语言处理 (NLP) 领域取得了显著成功,催生了如 ChatGPT 等广为人知的应用。然而,这些模型对对抗攻击的脆弱性仍然是一个重大隐患。与图像等连续域不同,文本存在于离散空间中,使得在句子、词或字符级别上的微小改动也极易被人类察觉。这种固有的离散性也使常规优化技术的使用变得复杂,因为文本是不可微的。以往关于文本对抗攻击的研究集中在字符级、词级、句子级和多级方法,这些方法由于需要多次查询或显著的语义改变,都存在效率低下或易被察觉的问题。在这项工作中,我们引入了一种新颖的对抗攻击方法 Emoji-Attack,它利用对 emoji 的操纵来创建微妙但有效的扰动。与字符级和词级策略不同,Emoji-Attack 将 emoji 作为独立的攻击层,导致更不明显的改变且对文本的破坏极小。这种方法在以前的研究中很大程度上未被探索,这些研究通常将 emoji 插入作为字符级攻击的扩展。我们的实验表明,Emoji-Attack 在大小模型上均实现了强大的攻击性能,使其成为增强 NLP 系统对抗鲁棒性的一项极具前景的技术。
引用
@article{arxiv.2502.17392,
title = {Emoti-Attack: Zero-Perturbation Adversarial Attacks on NLP Systems via Emoji Sequences},
author = {Yangshijie Zhang},
journal= {arXiv preprint arXiv:2502.17392},
year = {2025}
}