中文

X-MuTeST:面向可解释仇恨言论检测的多语言基准与新型大语言模型辅助解释框架

计算与语言 2026-01-07 v1

摘要

社交媒体上的仇恨言论检测在准确率和可解释性方面面临挑战,尤其是针对少数语言(尤其是印度语言)。我们提出了一种新颖的可解释性驱动训练框架,X-MuTeST(eXplainable Multilingual haTe Speech deTection),用于仇恨言论检测,该框架将大语言模型(LLM)的高层语义推理与传统注意力增强技术相结合。我们将此研究扩展至印地语和泰卢固语, alongside 英语,通过为每个单词提供基准的人类标注论证来说明分配的类别标签。X-MuTeST 可解释方法通过计算原始文本预测概率与单字、双字和三字预测概率之间的差异来计算。最终解释由 LLM 解释与 X-MuTeST 解释的并集计算得出。我们表明,利用人类论证进行训练可提升分类性能和可解释性。此外,将人类论证与我们的可解释方法结合用于细化模型注意力,可进一步获得改进。我们使用如 Token-F1 和 IOU-F1 等 Plausibility 指标,以及 Comprehensiveness 和 Sufficiency 等 Faithfulness 指标对可解释性进行评估。通过聚焦资源不足的语言,我们的工作推动了跨多语言语境的仇恨言论检测。该数据集包含 6,004 条印地语、4,492 条泰卢固语和 6,334 条英语样本的 token 级别论证标注。数据和代码均可在 https://github.com/ziarehman30/X-MuTeST 获取。

关键词

引用

@article{arxiv.2601.03194,
  title  = {X-MuTeST: A Multilingual Benchmark for Explainable Hate Speech Detection and A Novel LLM-consulted Explanation Framework},
  author = {Mohammad Zia Ur Rehman and Sai Kartheek Reddy Kasu and Shashivardhan Reddy Koppula and Sai Rithwik Reddy Chirra and Shwetank Shekhar Singh and Nagendra Kumar},
  journal= {arXiv preprint arXiv:2601.03194},
  year   = {2026}
}

备注

Accepted in the proceedings of AAAI 2026