TextDefense:基于词重要性熵的对抗文本检测
计算与语言
2023-02-14 v1 人工智能
密码学与安全
摘要
当前,自然语言处理(NLP)模型被广泛应用于各种场景。然而,与所有深度模型一样,NLP模型易受对抗生成文本的攻击。大量工作致力于缓解对抗攻击带来的脆弱性。尽管如此,现有工作缺乏全面的防御,每项工作要么针对特定攻击类别,要么受限于计算开销、无法抵御自适应攻击等。本文详尽调研了NLP中的对抗攻击算法,我们的实证研究发现攻击算法主要破坏文本中词的重要性分布。训练良好的模型能够区分干净文本与对抗文本之间细微的重要性分布差异。基于这一直觉,我们提出TextDefense,一种利用目标模型能力防御对抗攻击且无需先验知识的新型对抗样本检测框架。TextDefense与以往方法不同,它利用目标模型进行检测,因此与攻击类型无关。我们的大量实验表明,TextDefense可应用于不同架构、数据集和攻击方法,并优于现有方法。我们还发现影响TextDefense性能的主要因素是目标模型的泛化能力。通过分析目标模型的属性和对抗样本的属性,我们给出了对NLP中对抗攻击及我们防御方法原理的见解。
引用
@article{arxiv.2302.05892,
title = {TextDefense: Adversarial Text Detection based on Word Importance Entropy},
author = {Lujia Shen and Xuhong Zhang and Shouling Ji and Yuwen Pu and Chunpeng Ge and Xing Yang and Yanghe Feng},
journal= {arXiv preprint arXiv:2302.05892},
year = {2023}
}