中文

验证自动可信度评估的鲁棒性

计算与语言 2026-03-04 v3 机器学习

摘要

文本分类方法作为检测低可信度内容(如假新闻、社交媒体机器人、宣传文本等)的一种手段已被广泛研究。相当准确的模型(可能基于深度神经网络)有助于对公共电子平台进行内容审核,并常导致内容创作者面临投稿被拒或已发布文本被移除。在规避进一步检测的动机驱使下,内容创作者试图对文本进行轻微修改(即对抗样本攻击),利用分类器的弱点从而产生不同的输出。本文系统性地测试了常见文本分类器对现有攻击技术的鲁棒性,发现输入文本中保持语义的改动确实能误导模型。我们所测试的方法侧重于寻找文本中的脆弱片段并替换单个字符或词语,同时考虑原始内容与替换内容之间的相似性。我们还引入了 BODEGA:一个用于在模拟真实内容审核用例的评估框架中,针对四项 misinformation 检测任务测试受害模型与攻击方法的基准。受攻击的任务包括(1)事实核查以及(2)极端党派新闻、(3)宣传文本和(4)谣言的检测。实验结果表明,现代大语言模型往往比先前较小的方案更易受攻击,例如针对 GEMMA 的攻击成功率比针对 BERT 的高出至多 27%。最后,我们手动分析了一部分对抗样本,核查成功攻击中所使用的修改类型。

关键词

引用

@article{arxiv.2303.08032,
  title  = {Verifying the Robustness of Automatic Credibility Assessment},
  author = {Piotr Przybyła and Alexander Shvets and Horacio Saggion},
  journal= {arXiv preprint arXiv:2303.08032},
  year   = {2026}
}