引导扰动敏感性(GPS):通过嵌入稳定性与词重要性检测对抗文本
机器学习
2026-01-30 v2 人工智能
计算与语言
摘要
对抗文本攻击仍然是Transformer模型的持续威胁,但现有防御方法通常是特定于攻击的或需要昂贵的模型重训练,为攻击无关的检测留下了空白。我们引入引导扰动敏感性(GPS),一种通过测量重要词被遮蔽时嵌入表示的变化来识别对抗样本的检测框架。GPS首先使用重要性启发式对词进行排序,然后测量对遮蔽前k个关键词的嵌入敏感性,并用BiLSTM检测器处理生成的模式。实验表明,对抗扰动词表现出与自然语言重要词不成比例的高遮蔽敏感性。在三个数据集、三种攻击类型和两个受害者模型上,GPS实现了超过85%的检测准确率,并在计算成本通常更低的情况下展现出与现有最先进方法相当的性能。使用归一化折扣累积增益(NDCG)衡量扰动识别质量,我们证明基于梯度的排序显著优于注意力、混合和随机选择方法,识别质量与词级攻击的检测性能高度相关(ρ = 0.65)。GPS可泛化至未见数据集、攻击和模型而无需重训练,为对抗文本检测提供了实用方案。
引用
@article{arxiv.2508.11667,
title = {Guided Perturbation Sensitivity (GPS): Detecting Adversarial Text via Embedding Stability and Word Importance},
author = {Bryan E. Tuck and Rakesh M. Verma},
journal= {arXiv preprint arXiv:2508.11667},
year = {2026}
}
备注
19 pages, 19 figures, 8 tables. Accepted to AAAI 2026. Code available at https://github.com/ReDASers/Guided-Perturbation-Sensitivity