中文

SEP-Attack:面向迁移式文本对抗攻击的简单有效范式

计算与语言 2026-05-26 v1 人工智能

摘要

尽管深度神经网络在现代Web和语言应用中表现出色,但仍然容易受到对抗攻击,尤其是无需访问受害模型即可生成对抗样本的迁移式攻击。在文本领域,迁移式攻击仍鲜有探索,仅有少数研究针对这一具有挑战性的问题,且往往因对子模型的平等处理或不准确估计重要性得分而得不到最佳结果。为此,我们提出了一种简单却有效的迁移式文本对抗攻击范式,称为SEP-Attack。具体而言,我们采用行列式点过程(DPP)生成多样化的子模型集成权重,代表子模型的可迁移性。利用这些权重,我们引入一种新的指标来评估预测置信度得分,这些得分随后用于计算词语的重要性得分并生成对抗候选方案。最后,我们对每个候选方案的迁移性得分进行量化,并选择得分最高的方案作为最终的可迁移对抗样本。在四个数据集和两个真实API上进行的实验表明,SEP-Attack显著优于状态-of-the-art基线。

关键词

引用

@article{arxiv.2605.24958,
  title  = {SEP-Attack: A Simple and Effective Paradigm for Transfer-Based Textual Adversarial Attack},
  author = {Han Liu and Zhi Xu and Xiaotong Zhang and Feng Zhang and Xiaoming Xu and Wei Wang and Fenglong Ma and Hong Yu},
  journal= {arXiv preprint arXiv:2605.24958},
  year   = {2026}
}