中文

基于梯度引导的掩码语言模型用于检测文本对抗攻击

计算与语言 2025-04-15 v1 人工智能 机器学习

摘要

文本对抗样本严重威胁自然语言处理系统的可靠性。近期研究表明,对抗样本倾向于偏离正常文本的底层manifold,而预训练的掩码语言模型可近似正常数据的manifold。这些发现启发我们利用掩码语言模型检测文本对抗攻击。首先,我们引入基于掩码语言模型的检测方法 (MLMD),利用掩码和解掩码操作 MLM 目标,诱导正常文本与对抗文本之间manifold 变化的差异。尽管 MLMD 实现了竞争性的检测性能,但其穷举式逐个掩码策略引入显著的计算开销。我们的后验分析揭示,输入中大量非关键词在检测中并不重要,却消耗资源。基于此,我们引入梯度引导的 MLMD (GradMLMD),利用梯度信息识别并跳过非关键词,从而在不损失检测性能的情况下显著降低资源消耗。

关键词

引用

@article{arxiv.2504.08798,
  title  = {Exploring Gradient-Guided Masked Language Model to Detect Textual Adversarial Attacks},
  author = {Xiaomei Zhang and Zhaoxi Zhang and Yanjun Zhang and Xufei Zheng and Leo Yu Zhang and Shengshan Hu and Shirui Pan},
  journal= {arXiv preprint arXiv:2504.08798},
  year   = {2025}
}