中文

基于 Transformer 的文本归因对抗鲁棒性估计

机器学习 2022-12-20 v1 人工智能

摘要

解释是深度神经网络(DNN)分类器的关键组成部分。在高风险应用中,忠实且鲁棒的解释对于理解和信任 DNN 分类器至关重要。然而,近期研究表明,文本分类器中最先进的归因方法容易受到难以察觉的对抗性扰动的影响,这些扰动在保持正确预测结果的同时显著改变解释。若未被发现,这会严重误导 DNN 的用户。因此,理解此类对抗性扰动对网络解释及其可感知性的影响至关重要。在这项工作中,我们基于 Lipschitz 连续性,为文本分类中的归因鲁棒性(AR)建立了一个新颖的定义。关键在于,它同时反映了由对抗性输入改变引起的归因变化以及此类改变的可感知性。此外,我们引入了一套广泛的文本相似度度量,以有效捕捉两个文本样本之间的局部性以及文本中对抗性扰动的不可感知性。随后,我们提出了新颖的 TransformerExplanationAttack(TEA),这是一种强大的对抗攻击方法,能为文本分类中的归因鲁棒性提供紧致估计。TEA 利用最先进的语言模型来提取词语替换,从而生成流畅、符合上下文的对抗样本。最后,通过在多种文本分类架构上的实验,我们表明 TEA 始终优于当前最先进的 AR 估计器,所产生的扰动能在更大程度上改变解释,同时更加流畅且更不易被察觉。

关键词

引用

@article{arxiv.2212.09155,
  title  = {Estimating the Adversarial Robustness of Attributions in Text with Transformers},
  author = {Adam Ivankay and Mattia Rigotti and Ivan Girardi and Chiara Marchiori and Pascal Frossard},
  journal= {arXiv preprint arXiv:2212.09155},
  year   = {2022}
}