中文

面向恶意评论鲁棒性假新闻检测的分组自适应对抗学习

机器学习 2026-02-06 v3 人工智能 计算与语言

摘要

在线假新闻严重扭曲公众判断,并侵蚀社交平台的可信度。尽管现有检测器在基准数据集上取得了具有竞争力的性能,但它们仍然显著易受专门设计用于诱发误分类的恶意评论的影响。这一不断演变的威胁态势要求检测系统同时兼顾预测准确性与结构鲁棒性。然而,现有检测器往往难以泛化到多样且新颖的评论攻击模式。为弥合这一差距,我们提出 AdComment,一种用于增强对多样化恶意评论鲁棒性的自适应对抗训练框架。基于认知心理学,我们将对抗性评论划分为事实歪曲、逻辑混淆和情感操纵,并利用大语言模型(LLM)合成多样化、类别特定的扰动。我们框架的核心是一种 InfoDirichlet 重采样(IDR)机制,该机制在训练过程中动态调整恶意评论的比例,从而将优化方向引导至模型最易受攻击的区域。实验结果表明,我们的方法在三个基准数据集上取得了当前最优性能,F1 分数分别提升了 17.9%、14.5% 和 9.0%。

关键词

引用

@article{arxiv.2510.09712,
  title  = {Group-Adaptive Adversarial Learning for Robust Fake News Detection Against Malicious Comments},
  author = {Zhao Tong and Chunlin Gong and Yimeng Gu and Haichao Shi and Qiang Liu and Shu Wu and Xiao-Yu Zhang},
  journal= {arXiv preprint arXiv:2510.09712},
  year   = {2026}
}

备注

10 pages, 12 figures