中文

当仇恨遇见事实:基于LLM的仇恨言论可查证性检测

计算与语言 2026-03-27 v1

摘要

在线仇恨内容往往以类似事实的方式表达,尤其是在协调性网络骚扰活动和极端主义宣传中。未能同时解决仇恨言论和虚假信息问题会加剧偏见,强化有害刻板印�,使旁观者暴露于心理痛苦之中,同时污染公共讨论。此外,这些信息需要更多的工作来自由内容审查员,因为他们必须评估有害性和真实性,即事实核查。为此,我们发布了WSF-ARG+,这是第一个结合仇恨言论与可查证性信息的数据集。我们还引入了一种新的LLM-in-the-loop框架来促进可查证主张的注释。我们测试了这个框架,使用12个不同大小和架构的开源 LLM。我们通过广泛的人类评估进行了验证,表明我们的LLM-in-the-loop框架在不损害数据注释质量的同时显著减少了人类工作量。最后,我们表明具有可查证性主张的仇恨言论显示出显著更高的骚扰和仇恨程度,并且将可查证性标签纳入仇恨言论检测中,可使大型模型在平均macro-F1指标上提高0.213和0.154。

关键词

引用

@article{arxiv.2603.25269,
  title  = {When Hate Meets Facts: LLMs-in-the-Loop for Check-worthiness Detection in Hate Speech},
  author = {Nicolás Benjamín Ocampo and Tommaso Caselli and Davide Ceolin},
  journal= {arXiv preprint arXiv:2603.25269},
  year   = {2026}
}