中文

SoftHateBench: 评估审核模型对抗推理驱动、符合政策的敌意

计算与语言 2026-01-29 v1

摘要

社交媒体上的在线仇恨言论范围从公开的辱骂和威胁(“硬仇恨言论”)到“软仇恨言论”:表面上看起来合理,但使用框架和价值导向的论点来引导受众指责或排斥目标群体的言论。我们假设,当前主要针对表面毒性线索优化的审核系统,对这种推理驱动的敌意并不鲁棒,然而现有的基准测试并未系统地衡量这一差距。我们引入了\textbf{\textsc{SoftHateBench}},一个生成式基准测试,它在保留潜在敌意立场的同时生成软仇恨变体。为了生成软仇恨,我们将“论题模型”(AMT)和“关联理论”(RT)整合在一个统一的框架中:AMT提供了将明确的仇恨立场重写为看似中立讨论的骨干论证结构,同时保留立场;RT指导生成以保持AMT链的逻辑连贯性。该基准测试涵盖\textbf{7}个社会文化领域和\textbf{28}个目标群体,包含\textbf{4,745}个软仇恨实例。对基于编码器的检测器、通用LLM和安全模型的评估显示,从硬层级到软层级性能持续下降:能够检测到明确敌意的系统,当相同的立场通过微妙的、基于推理的语言传达时,往往失败。\textcolor{red}{\textbf{免责声明。} 包含仅用于研究的攻击性示例。}

关键词

引用

@article{arxiv.2601.20256,
  title  = {SoftHateBench: Evaluating Moderation Models Against Reasoning-Driven, Policy-Compliant Hostility},
  author = {Xuanyu Su and Diana Inkpen and Nathalie Japkowicz},
  journal= {arXiv preprint arXiv:2601.20256},
  year   = {2026}
}