中文

语义隐蔽:使用多种方法对 NLP 进行对抗性文本攻击

计算与语言 2024-04-09 v1 密码学与安全 机器学习

摘要

在机器翻译、情感分析和问答等各种实际应用中,NLP 模型发挥着关键作用,促进了从医疗保健到金融等各个领域的高效沟通与决策过程。然而,文本对抗攻击对这些自然语言处理模型的鲁棒性构成了重大挑战。这些攻击涉及对输入文本的蓄意操纵,以在保持人类可理解性的同时误导模型的预测。尽管像 BERT 这样的最先进模型在各种自然语言处理任务中取得了显著的性能,但研究发现它们仍然容易受到输入文本中对抗性扰动的影响。为了解决文本分类器对对抗攻击的脆弱性,本文使用受害者模型 BERT 探索了三种不同的攻击机制:BERT-on-BERT 攻击、PWWS 攻击和 Fraud Bargain 攻击(FBA)。利用 IMDB、AG News 和 SST2 数据集,进行了彻底的比较分析,以评估这些攻击对 BERT 分类器模型的有效性。分析表明,PWWS 是最强大的对手,在多种评估场景中始终优于其他方法,从而强调了其在为文本分类生成对抗样本方面的有效性。通过全面的实验,评估了这些攻击的性能,结果表明 PWWS 攻击优于其他攻击,表现出更低的运行时间、更高的准确率和良好的语义相似度得分。本文的核心见解在于评估三种流行的最先进攻击机制的相对性能。

关键词

引用

@article{arxiv.2404.05159,
  title  = {Semantic Stealth: Adversarial Text Attacks on NLP Using Several Methods},
  author = {Roopkatha Dey and Aivy Debnath and Sayak Kumar Dutta and Kaustav Ghosh and Arijit Mitra and Arghya Roy Chowdhury and Jaydip Sen},
  journal= {arXiv preprint arXiv:2404.05159},
  year   = {2024}
}

备注

This report pertains to the Capstone Project done by Group 2 of the Fall batch of 2023 students at Praxis Tech School, Kolkata, India. The reports consists of 28 pages and it includes 10 tables. This is the preprint which will be submitted to IEEE CONIT 2024 for review