中文

人类与 LLM 在仇恨言论标注中的偏见:标注者与目标对象的社会人口学分析

计算与语言 2025-06-13 v6 人工智能 人机交互

摘要

在线平台的兴起加剧了仇恨言论的传播,亟需可扩展且有效的检测方法。然而,仇恨言论检测系统的准确性高度依赖人类标注数据,而这类数据本身就天然易受偏见影响。虽然已有研究探讨过此问题,但标注者特征与仇恨言论目标特征之间的相互作用仍未被探索。我们利用包含标注者与目标对象丰富社会人口学信息的大型数据集,揭示了人类偏见如何与目标属性相关。我们的分析发现,存在广泛的偏见,我们对其强度和流行度进行量化描述和特征化,结果显示出显著差异。此外,我们比较了人类偏见与基于角色的大语言模型(LLM)所表现的偏见。我们的发现表明,尽管基于角色的 LLM 确实 exhibits 偏见,但这些偏见与人类标注者的偏见有显著差异。总体而言,本工作提供了关于人类在仇恨言论标注中偏见的全新且细致的结果,以及针对 AI 驱动的仇恨言论检测系统设计的 fresh insight。

关键词

引用

@article{arxiv.2410.07991,
  title  = {Human and LLM Biases in Hate Speech Annotations: A Socio-Demographic Analysis of Annotators and Targets},
  author = {Tommaso Giorgi and Lorenzo Cima and Tiziano Fagni and Marco Avvenuti and Stefano Cresci},
  journal= {arXiv preprint arXiv:2410.07991},
  year   = {2025}
}

备注

Article published in ICWSM'25 - 19th AAAI Conference on Web and Social Media. Please, cite the published version