xList-Hate:面向可解释且通用的仇恨言论检测的清单框架
计算与语言
2026-02-06 v1 人工智能
摘要
仇恨言论检测通常被建模为直接的二元分类问题,尽管该概念是通过多个相互作用的因素定义的,这些因素在不同的法律框架、平台政策和标注指南下各不相同。因此,监督模型常常会过拟合特定数据集的定义,并在域移和标注噪声下表现有限。我们引入 xList-Hate,一种将仇恨言论检测分解为基于广泛共识规范性标准的显式概念层面问题清单的诊断框架。每个问题都由大型语言模型(LLM)独立回答,产生二元诊断表示,从而捕获仇恨内容特征而不直接预测最终标签。这些诊断信号随后被整合到轻量级、完全可解释的决策树中,产生透明且可审计的预测。我们在多个仇恨言论基准测试和模型族之间进行评估,比较了零样本 LLM 分类和领域内监督微调。虽然监督方法通常最大化领域内性能,但我们在跨数据集鲁棒性和域移下的相对性能方面 consistently 提升。此外,对不同步情情况的定性分析表明,该框架对某些形式的标注不一致性和情境模糊性较不敏感。关键是,该方法通过显式决策路径和因子层面分析实现了细粒度可解释性。我们的结果表明,将仇恨言论检测重新建模为诊断推理任务而非单一分类问题,为内容 moderation 提供了一种稳健、可解释且可扩展的替代方案。
引用
@article{arxiv.2602.05874,
title = {xList-Hate: A Checklist-Based Framework for Interpretable and Generalizable Hate Speech Detection},
author = {Adrián Girón and Pablo Miralles and Javier Huertas-Tato and Sergio D'Antonio and David Camacho},
journal= {arXiv preprint arXiv:2602.05874},
year = {2026}
}