中文

HARE:基于逐步推理的可解释仇恨言论检测

计算与语言 2023-11-23 v2

摘要

随着社交媒体的 proliferation,准确检测仇恨言论对于确保网络安全变得至关重要。为应对细微形式的仇恨言论,识别并透彻解释仇恨言论以帮助用户理解其有害影响十分重要。近期的基准尝试通过在仇恨文本隐含意义的自由文本标注上训练生成模型来解决此问题。然而,我们发现现有标注方案中存在显著的推理缺口,这可能阻碍检测模型的监督。本文中,我们引入一种仇恨言论检测框架HARE,其利用大语言模型(LLM)的推理能力填补这些仇恨言论解释中的缺口,从而实现对检测模型的有效监督。在SBIC和Implicit Hate基准上的实验表明,我们使用模型生成数据的方法始终优于使用现有自由文本人工标注的基线。分析表明,我们的方法提升了训练模型的解释质量并改善了对未见过数据集的泛化。我们的代码可在 https://github.com/joonkeekim/hare-hate-speech.git 获取。

关键词

引用

@article{arxiv.2311.00321,
  title  = {HARE: Explainable Hate Speech Detection with Step-by-Step Reasoning},
  author = {Yongjin Yang and Joonkee Kim and Yujin Kim and Namgyu Ho and James Thorne and Se-young Yun},
  journal= {arXiv preprint arXiv:2311.00321},
  year   = {2023}
}

备注

Findings of EMNLP 2023; The first three authors contribute equally