迈向包容性有害内容审核:应对处理LLM生成内容的有害性分类器对抗攻击的脆弱性
计算与语言
2026-05-26 v2
摘要
由于大型语言模型(LLM)的广泛使用,在线机器生成内容的数量急剧增长,给内容审核系统带来了新的挑战。传统的內容审核分类器通常在人类生成的文本上训练,由于LLM生成的文本偏离其训练数据以及旨在逃避检测的对抗攻击,这些分类器会出现误分类。当前的防御策略是反应性的而非主动性的,因为它们依赖于对抗训练或外部检测模型来识别攻击。在本工作中,我们旨在识别导致误分类的有毒分类器脆弱组件,提出了一种基于机制可解释性技术的新策略。我们的研究集中在微调的BERT和RoBERTa分类器上,在跨越各种少数群体的多样化数据集上进行测试。我们使用对抗攻击技术来识别脆弱电路。最后,我们抑制这些脆弱电路,提高了对抗攻击下的性能。我们还提供了这些脆弱电路在人口统计层面的见解,揭示了模型训练中的公平性和鲁棒性差距。我们发现模型具有不同的注意力头,它们要么对性能至关重要,要么容易受到攻击,而抑制脆弱头能提高对抗输入上的性能。我们还发现,不同的人口群体由不同的头负责脆弱性,这可以为有毒检测模型的更具包容性的开发提供信息。
引用
@article{arxiv.2509.12672,
title = {Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content},
author = {Shaz Furniturewala and Arkaitz Zubiaga},
journal= {arXiv preprint arXiv:2509.12672},
year = {2026}
}