调节伤害:针对YouTube评论的大语言模型网络暴力检测基准测试
计算与语言
2025-06-03 v3 人工智能
摘要
随着在线平台的不断增长,评论区越来越多地包含剥削行为,这些行为损害用户体验和福祉。本研究对三大主流大语言模型——OpenAI GPT-4.1、Google Gemini 1.5 Pro和Anthropic Claude 3 Opus——进行了基准测试,使用来自游戏、生活方式、美食vlog和音乐频道高滥用线程中抽样的5,080条YouTube评论。数据集包含1,334条有害信息和3,746条非有害信息,英文、阿拉伯语和印尼语,由两位独立审阅员审核,产生显著一致性(Cohen's kappa = 0.83)。在统一的提示和确定性设置下,GPT-4.1在整体平衡方面表现最佳,F1得分为0.863,精确率为0.887,召回率为0.841。Gemini标记的有害帖子比例最高(召回率=0.875),但其精确率降至0.767,因频繁误报。Claude提供了最高的精确率(0.920)和最低的误报率(0.022),但其召回率下降至0.720。定性分析显示,三种模型在处理讽刺、隐性侮辱和混合语言俚语方面均表现出困难。这些结果凸显了需要组合互补模型、纳入对话上下文、针对 underrepresented 语言和隐性滥用进行微调的 moderation pipeline。本研究公开发布了去识别后的数据集和完整提示词,以促进可重复性和自动化内容 moderation 领域的进一步进展。
引用
@article{arxiv.2505.18927,
title = {Moderating Harm: Benchmarking Large Language Models for Cyberbullying Detection in YouTube Comments},
author = {Amel Muminovic},
journal= {arXiv preprint arXiv:2505.18927},
year = {2025}
}
备注
9 pages, 3 tables, 1 figure