中文

BeamAttack:通过束搜索与混合语义空间生成高质量文本对抗样本

计算与语言 2023-03-14 v1 密码学与安全

摘要

基于神经网络的天然语言处理模型易受对抗样本的攻击。这些对抗样本对人类读者而言难以察觉,却能误导模型做出错误预测。在黑盒设定下,攻击者可在不了解模型参数与架构的情况下欺骗模型。先前关于词级攻击的研究广泛采用单一语义空间与贪心搜索作为搜索策略。然而,这些方法未能在攻击成功率、对抗样本质量与时间消耗之间取得平衡。本文提出 BeamAttack,一种利用混合语义空间与改进束搜索来构造高质量对抗样本的文本攻击算法。大量实验表明,BeamAttack 能在节省大量查询与时间的同时提升攻击成功率,例如,在攻击来自 MR 数据集的样本时,其攻击成功率较贪心搜索最高提升 7%。与启发式搜索相比,BeamAttack 最多可节省 85% 的模型查询并达到具有竞争力的攻击成功率。BeamAttack 生成的对抗样本具有高度可迁移性,并能在对抗训练过程中有效提升模型的鲁棒性。代码见 https://github.com/zhuhai-ustc/beamattack/tree/master

关键词

引用

@article{arxiv.2303.07199,
  title  = {BeamAttack: Generating High-quality Textual Adversarial Examples through Beam Search and Mixed Semantic Spaces},
  author = {Hai Zhu and Qingyang Zhao and Yuren Wu},
  journal= {arXiv preprint arXiv:2303.07199},
  year   = {2023}
}

备注

PAKDD2023