中文

基于BERT的阿拉伯语同义词对抗样本用于文本分类

计算与语言 2024-02-07 v1

摘要

文本分类系统已被证明容易受到对抗性文本样本的攻击,这些样本是原始文本的修改版本,通常不易被人类察觉,却能迫使文本分类模型改变其分类结果。通常,量化对抗性文本攻击影响的研究工作仅应用于以英语训练的模型。在本文中,我们介绍了首个针对阿拉伯语对抗性攻击的词级研究。具体来说,我们在黑盒设置下,使用基于BERT模型的掩码语言建模(MLM)任务进行同义词(词级)攻击,以评估最先进的文本分类模型对阿拉伯语对抗性攻击的鲁棒性。为了评估使用我们基于BERT的同义词攻击生成的新对抗样本的语法和语义相似性,我们邀请了四位人类评估员来评估和比较生成的对抗样本与其原始样本。我们还研究了这些新生成的阿拉伯语对抗样本向各种模型的可迁移性,并调查了在BERT模型上针对这些对抗样本的防御机制的有效性。我们发现,微调后的BERT模型比我们训练的其他深度神经网络(DNN)模型(如WordCNN和WordLSTM)更容易受到我们的同义词攻击。我们还发现,微调后的BERT模型更容易受到迁移攻击。最后,我们发现,在应用对抗训练作为初始防御机制后,微调后的BERT模型成功恢复了至少2%的准确率。

关键词

引用

@article{arxiv.2402.03477,
  title  = {Arabic Synonym BERT-based Adversarial Examples for Text Classification},
  author = {Norah Alshahrani and Saied Alshahrani and Esma Wali and Jeanna Matthews},
  journal= {arXiv preprint arXiv:2402.03477},
  year   = {2024}
}

备注

This paper is accepted at The 18th Conference of the European Chapter of the Association for Computational Linguistics (Student Research Workshop), March 17-22, 2024