ContiGuard:面向演化式对抗性扰动的持续毒性检测框架
计算与语言
2026-03-17 v1 人工智能
摘要
毒性检测旨在缓解有害内容(如仇恨评论、帖子及社交活动中的信息)的传播,以维护健康的线上社交环境。然而,恶意用户不断开发对抗性扰动,以掩饰有害内容并规避检测器。传统检测器或方法在时间上是静态的,无法应对这些演化中的对抗性扰动。因此,持续学习成为动态提升检测能力以应对演化扰动的合理方法。然而,跨扰动的差异会阻碍检测器对扰动文本进行持续学习。更重要的是,扰动引起的噪声会扭曲语义以降低理解能力,并损害关键特征学习,使检测器对扰动不够敏感。这放大了针对演化扰动的持续学习挑战。本文提出ContiGuard——首个针对检测器在时间演化扰动文本上进行持续学习的框架(称为持续毒性检测),以使检测器能够持续更新能力并维持对演化扰动的持久韧性。具体而言,为提升理解能力,我们提出了基于大语言模型的语义丰富策略,通过动态整合大语言模型挖掘出的可能含义和毒性相关线索,融入扰动文本中以改善理解。为缓解非关键特征并放大关键特征,我们提出了基于判别性特征学习的策略,通过强化判别性特征同时抑制较不判别性特征,以塑造检测的鲁健分类边界。
引用
@article{arxiv.2603.14843,
title = {ContiGuard: A Framework for Continual Toxicity Detection Against Evolving Evasive Perturbations},
author = {Hankun Kang and Xin Miao and Jianhao Chen and Jintao Wen and Mayi Xu and Weiyu Zhang and Wenpeng Lu and Tieyun Qian},
journal= {arXiv preprint arXiv:2603.14843},
year = {2026}
}