针对文本分类器的可逆跳跃攻击与修改约减
密码学与安全
2024-03-25 v1 计算与语言
机器学习
摘要
近期关于对抗样本的研究揭示了自然语言处理(NLP)模型的脆弱性。现有的对抗样本生成技术通常由确定性分层规则驱动,这些规则对最优对抗样本是不可知的,这种策略往往导致生成的对抗样本在修改幅度与攻击成功率之间的平衡上达到次优。为此,在本研究中,我们提出了两种算法:可逆跳跃攻击(RJA)和 Metropolis-Hasting 修改约减(MMR),分别用于生成高效对抗样本和提高样本的不可感知性。RJA 利用一种新颖的随机化机制来扩大搜索空间,并高效地调整对抗样本中受扰动词的数量。利用这些生成的对抗样本,MMR 应用 Metropolis-Hasting 采样器来增强对抗样本的不可感知性。大量实验表明,RJA-MMR 在攻击性能、不可感知性、流畅性和语法正确性方面均优于当前 SOTA 方法。
引用
@article{arxiv.2403.14731,
title = {Reversible Jump Attack to Textual Classifiers with Modification Reduction},
author = {Mingze Ni and Zhensu Sun and Wei Liu},
journal= {arXiv preprint arXiv:2403.14731},
year = {2024}
}