中文

基于多目标化的有效且不易察觉的对抗性文本攻击

计算与语言 2023-12-18 v4 神经与进化计算

摘要

对抗性文本攻击领域在过去几年中显著发展,其中通常考虑的目标是制作能够成功欺骗目标模型的对抗样本(AEs)。然而,对于实际攻击者同样至关重要的攻击不易察觉性,往往被先前的研究所忽略。因此,生成的对抗样本往往与原始人类撰写的文本存在明显的结构和语义差异,使其容易被察觉。在这项工作中,我们倡导利用多目标化来解决这个问题。具体来说,我们将生成对抗样本的问题重新表述为一个多目标优化问题,其中攻击不易察觉性被视为一个辅助目标。然后,我们提出了一种简单而有效的进化算法,名为HydraText,来解决这个问题。据我们所知,HydraText是目前唯一能够有效应用于基于分数和基于决策的攻击设置的方法。涉及44237个实例的详尽实验表明,HydraText始终如一地实现了具有竞争力的攻击成功率,并且比最近提出的攻击方法具有更好的攻击不易察觉性。一项人类评估研究也表明,HydraText生成的对抗样本与人类撰写的文本更难以区分。最后,这些对抗样本表现出良好的可迁移性,并且可以通过对抗训练为目标模型带来显著的鲁棒性提升。

关键词

引用

@article{arxiv.2111.01528,
  title  = {Effective and Imperceptible Adversarial Textual Attack via Multi-objectivization},
  author = {Shengcai Liu and Ning Lu and Wenjing Hong and Chao Qian and Ke Tang},
  journal= {arXiv preprint arXiv:2111.01528},
  year   = {2023}
}