中文

数字守卫:GPT-4、Perspective API 和 Moderation API 能否可靠检测德国线上报纸读者评论中的仇恨言语?

计算与语言 2025-01-03 v1 机器学习

摘要

近年来,带有毒性内容和仇恨言语的现象在互联网上变得广泛。线上报纸和论坛的 moderator 们现在因法律法规的要求,需要仔细审查并必要时删除读者评论。这是一个耗时的过程。一些大型语言模型提供商已经提供了用于自动仇恨言语检测或识别有毒内容的解决方案。这些包括来自 OpenAI 的 GPT-4o、来自 Jigsaw(Google)的 Perspective API 以及来自 OpenAI 的 Moderation API。基于所选的德国测试数据集 HOCON34k,该数据集专为开发检测线上报纸读者评论仇恨言语的工具而创建,本文将这些解决方案相互比较,并将其与 HOCON34k 基线进行比较。该测试数据集包含 1,592 个标注文本样本。对于 GPT-4o,使用三种不同的提示方法,分别采用零样本、一样本和少样本方法。实验结果表明,GPT-4o 在两个基线之间表现更好,分别为 Perspective API 和 Moderation API,按照 MCC 和 F2-分数综合指标,超过 HOCON34k 基线约 5 个百分点。

关键词

引用

@article{arxiv.2501.01256,
  title  = {Digital Guardians: Can GPT-4, Perspective API, and Moderation API reliably detect hate speech in reader comments of German online newspapers?},
  author = {Manuel Weber and Moritz Huber and Maximilian Auch and Alexander Döschl and Max-Emanuel Keller and Peter Mandl},
  journal= {arXiv preprint arXiv:2501.01256},
  year   = {2025}
}