中文

HateXScore:用于评估仇恨言论解释中推理质量的指标套件

计算与语言 2026-01-21 v1 人工智能

摘要

仇恨言论检测是内容审核的关键组成部分,然而当前的评估框架很少评估为何一段文本被认定为仇恨言论。我们引入了 \textsf{HateXScore},这是一个四组件指标套件,旨在评估模型解释的推理质量。它评估 结论的明确性、 所引文本片段的忠实度与因果依据、 受保护群体识别(策略可配置),以及 这些元素之间的逻辑一致性。在六个多样化的仇恨言论数据集上进行评估后,\textsf{HateXScore} 旨在作为诊断补充,以揭示 Accuracy 或 F1 等标准指标无法察觉的可解释性失效与标注不一致问题。此外,人工评估显示出与 \textsf{HateXScore} 的强一致性,验证了其作为可信且透明审核实用工具的地位。\textcolor{red}{免责声明:本文包含敏感内容,可能会令部分读者感到不适。}

关键词

引用

@article{arxiv.2601.13547,
  title  = {HateXScore: A Metric Suite for Evaluating Reasoning Quality in Hate Speech Explanations},
  author = {Yujia Hu and Roy Ka-Wei Lee},
  journal= {arXiv preprint arXiv:2601.13547},
  year   = {2026}
}

备注

EACL 2026 Main Conference