面向有害在线内容的对抗鲁棒检测:一种计算设计科学方法
机器学习
2025-12-30 v3
摘要
社交媒体平台普遍存在有害内容,如仇恨言论、虚假信息和极端主义论调。机器学习(ML)模型被广泛采用用于检测此类内容;然而,它们在面临对抗攻击时仍高度脆弱,即恶意用户会通过微小修改文本来规避检测。因此,增强对抗鲁棒性至关重要,需要能够抵御多样化攻击(即 generalizability)的检测器,同时保持高的整体准确率。然而,同时实现最佳的 generalizability 与 accuracy 是具有挑战性的。在计算设计科学范式下,本研究采用分阶段方法:首先提出一种新型框架(基于大语言模型的样本生成与聚合,LLM-SGA),通过识别文本对抗攻击的关键不变性,并加以利用,以确保框架内的检测器具备强大的 generalizability。其次,我们在框架内实现我们的检测器(面向有害在线内容的对抗鲁棒检测器,ARHOCD),包含三个新型设计组件以提高检测准确率:(1)多个基检测器的集成,利用其互补优势;(2)一种新型权重分配方法,基于每个样本的可预测性和每个基检测器的能力动态调整权重,权重使用领域知识初始化并通过贝叶斯推断更新;(3)一种新型对抗训练策略,迭代优化基检测器和权重分配器。我们解决了现有对抗鲁棒性增强研究的多个局限性,并在三个覆盖仇恨言论、谣言和极端内容的数据集上对 ARHOCD 进行了实证评估。结果表明,ARHOCD 在对抗条件下具备强大的 generalizability 并提升了检测准确率。
引用
@article{arxiv.2512.17367,
title = {Adversarially Robust Detection of Harmful Online Content: A Computational Design Science Approach},
author = {Yidong Chai and Yi Liu and Mohammadreza Ebrahimi and Weifeng Li and Balaji Padmanabhan},
journal= {arXiv preprint arXiv:2512.17367},
year = {2025}
}