中文

利用语言模型生成的对抗样本攻击错误信息检测

计算与语言 2025-09-04 v2

摘要

大型语言模型有许多有益的应用,但它们是否也能被用来攻击社交媒体平台中的内容过滤算法?我们研究了生成对抗样本的挑战,以测试文本分类算法在检测低可信度内容(包括宣传、虚假声明、谣言和超党派新闻)时的鲁棒性。我们通过设置攻击者允许尝试的查询次数的现实限制来模拟内容审核。在我们的解决方案(TREPAT)中,初始改写由大型语言模型生成,其提示受到保持意义的NLP任务(如文本简化和风格迁移)的启发。随后,这些修改被分解为小的变化,通过束搜索过程应用,直到受害者分类器改变其决策。我们进行了(1)使用各种提示、模型和查询限制的定量评估,(2)对生成文本的有针对性的人工评估,以及(3)定性语言学分析。结果证实了我们的方法在受限场景下的优越性,特别是在输入文本较长(新闻文章)的情况下,此时穷举搜索不可行。

关键词

引用

@article{arxiv.2410.20940,
  title  = {Attacking Misinformation Detection Using Adversarial Examples Generated by Language Models},
  author = {Piotr Przybyła and Euan McGill and Horacio Saggion},
  journal= {arXiv preprint arXiv:2410.20940},
  year   = {2025}
}

备注

Presented at EMNLP 2025