中文

基于掩码语言模型的多粒度藏语文本对抗攻击方法

计算与语言 2024-12-04 v1 密码学与安全

摘要

在社交媒体中,神经网络模型已被应用于仇恨言论检测、情感分析等领域,但神经网络模型容易受到对抗攻击。例如,在文本分类任务中,攻击者精心引入 barely 改变原语义的扰动,以误导模型作出不同的预测。通过研究文本对抗攻击方法,可以评估和改进语言模型的鲁棒性。目前,该领域的大多数研究集中在英文上,也有一定数量的中文研究。然而,针对中文少数语言的研究较少。随着人工智能技术的快速发展和中文少数语言模型的出现,文本对抗攻击成为中文少数语言信息处理的新挑战。针对这一情况,我们提出一种基于掩码语言模型的多粒度藏语文本对抗攻击方法,称为 TSTricker。我们利用掩码语言模型生成候选替换音节或单词,采用评分机制确定替换顺序,然后在几个微调的受害模型上进行攻击。实验结果表明,TSTricker 将分类模型的准确率降低超过 28.70%,并使分类模型改变了超过 90.60% 样本的预测,这比基线方法的攻击效果明显更高。

关键词

引用

@article{arxiv.2412.02343,
  title  = {Multi-Granularity Tibetan Textual Adversarial Attack Method Based on Masked Language Model},
  author = {Xi Cao and Nuo Qun and Quzong Gesang and Yulei Zhu and Trashi Nyima},
  journal= {arXiv preprint arXiv:2412.02343},
  year   = {2024}
}

备注

Revised Version; Accepted at WWW 2024 Workshop on SocialNLP