SEPP:基于预测概率相似性估计的对抗文本防御与检测
计算与语言
2021-10-14 v2
摘要
关于分类器如何处理输入文本存在两种情况,即误分类与正确分类。就误分类文本而言,分类器处理的文本包含错误预测文本和为欺骗称为受害者的分类器而生成的对抗文本。两类文本均被受害者误解,但仍可被其他分类器识别。这导致受害者与其他分类器间预测概率存在较大差距。相反,被受害者正确分类的文本常被其他分类器成功预测,从而产生较小差距。本文提出一种基于预测概率相似性估计(SEPP)的集成模型,以利用误分类预测中的大差距对比正确分类中的小差距。SEPP 随后纠正误分类文本的错误预测。我们通过不同类型的受害者分类器、分类任务和对抗攻击,展示了 SEPP 在防御与检测对抗文本方面的鲁棒性。
引用
@article{arxiv.2110.05748,
title = {SEPP: Similarity Estimation of Predicted Probabilities for Defending and Detecting Adversarial Text},
author = {Hoang-Quoc Nguyen-Son and Seira Hidano and Kazuhide Fukushima and Shinsaku Kiyomoto},
journal= {arXiv preprint arXiv:2110.05748},
year = {2021}
}
备注
PACLIC 35 (2021) (Oral)