破坏BERT:针对Twitter情感分析的梯度攻击
计算与语言
2025-04-03 v1 机器学习
摘要
社交媒体平台如Twitter日益依赖自然语言处理NLP技术来分析和理解用户生成内容中所表达的情感。一种这样的前沿NLP模型是双向编码器表示Transformer BERT,它在情感分析中得到广泛应用。BERT对对抗性攻击高度敏感。本文旨在审查此类模型在Twitter情感分析中的固有漏洞。旨在构建能够欺骗这些模型的针对性对抗文本框架,同时保持隐蔽性。与传统方法(如Importance Reweighting)不同,本框架的核心思想在于依赖梯度来优先考虑文本中各个词的重要性。它使用白盒方法以获得细粒度的灵敏度,确定对分类结果影响最大的词。本文分为三个相互关联的阶段。首先,在Twitter数据上微调预训练的BERT模型。随后分析模型的梯度以对词语重要性进行排序,迭代替换其中一些词语,直到找到可接受的解决方案。最后,评估对抗文本对定制训练的情感分类模型的有效性。这一评估有助于衡量对抗文本成功地在不引起警报的情况下破坏分类的能力。
关键词
引用
@article{arxiv.2504.01345,
title = {Breaking BERT: Gradient Attack on Twitter Sentiment Analysis for Targeted Misclassification},
author = {Akil Raj Subedi and Taniya Shah and Aswani Kumar Cherukuri and Thanos Vasilakos},
journal= {arXiv preprint arXiv:2504.01345},
year = {2025}
}