愚弄文本分类器中的解释
机器学习
2022-06-08 v1 计算与语言
密码学与安全
摘要
最先进的文本分类模型正日益依赖深度神经网络(DNN)。由于其黑盒性质,在真实场景部署中,分类器需要配有忠实且鲁棒的解释方法。然而,在视觉应用中已表明,解释方法易受局部、难以察觉的扰动影响,这些扰动可在不改变预测类别的情况下显著改变解释。我们在此表明此类扰动同样存在于文本分类器中。具体而言,我们提出 TextExplanationFooler(TEF),一种新颖的解释攻击算法,它对文本输入样本进行难以察觉的改动,使得广泛使用的解释方法的输出发生显著变化,同时保持分类器预测不变。我们在五个序列分类数据集上评估了 TEF 中属性鲁棒性估计的性能,每个数据集使用了三种 DNN 架构和三种 transformer 架构。TEF 能显著降低未扰动与扰动输入属性之间的相关性,表明所有模型和解释方法都易受 TEF 扰动影响。此外,我们评估了扰动向其他模型架构和属性方法的迁移性,并表明 TEF 扰动在目标模型和解释方法未知的场景中同样有效。最后,我们引入了一种半通用攻击,能够在不知晓被攻击分类器及解释方法的情况下,快速计算计算量轻的扰动。总体而言,我们的工作表明文本分类器中的解释非常脆弱,用户在关键应用中依赖它们之前需仔细解决其鲁棒性问题。
引用
@article{arxiv.2206.03178,
title = {Fooling Explanations in Text Classifiers},
author = {Adam Ivankay and Ivan Girardi and Chiara Marchiori and Pascal Frossard},
journal= {arXiv preprint arXiv:2206.03178},
year = {2022}
}