基于掩码语言模型的文本对抗样本检测
密码学与安全
2024-01-30 v3 人工智能
摘要
对抗攻击对机器学习模型在安全关键应用中的可靠部署构成严重威胁。它们可以通过轻微修改输入来误导当前模型做出错误预测。近来,大量研究表明对抗样本往往偏离正常样本的底层数据流形,而预训练的掩码语言模型能够拟合正常自然语言处理数据的流形。为探索如何利用掩码语言模型进行对抗检测,我们提出了一种新颖的文本对抗样本检测方法,即基于掩码语言模型的检测(Masked Language Model-based Detection, MLMD),该方法通过探究掩码语言模型所诱导的流形变化,在正常样本与对抗样本之间产生明显可区分的信号。MLMD具有即插即用的特性(即无需重新训练受害模型)以用于对抗防御,并且它与分类任务、受害模型的架构以及待防御的攻击方法无关。我们在多种基准文本数据集、广泛研究的机器学习模型以及最先进(SOTA)的对抗攻击(共计 种设置)上评估了MLMD。实验结果表明,MLMD能够取得强劲性能,在AG-NEWS、IMDB和SST-2数据集上的检测准确率分别高达0.984、0.967和0.901。此外,在检测准确率和F1分数上,MLMD优于或至少可与SOTA检测防御方法相媲美。在众多基于对抗样本离流形假设的防御中,本工作为捕捉流形变化提供了新视角。本工作的代码已公开于 \url{https://github.com/mlmddetection/MLMDdetection}。
引用
@article{arxiv.2304.08767,
title = {Masked Language Model Based Textual Adversarial Example Detection},
author = {Xiaomei Zhang and Zhaoxi Zhang and Qi Zhong and Xufei Zheng and Yanjun Zhang and Shengshan Hu and Leo Yu Zhang},
journal= {arXiv preprint arXiv:2304.08767},
year = {2024}
}
备注
13 pages,3 figures