大语言模型在低资源巴尔干语言中的有毒语言检测
计算与语言
2025-06-16 v2
摘要
在线有毒语言会造成真实伤害,尤其是在缺乏审核工具的地区。在本研究中,我们评估了大语言模型在塞尔维亚语、克罗地亚语和波斯尼亚语——数据标注有限的语言——中处理有毒评论的能力。我们构建并手动标注了一个包含4500条YouTube和TikTok评论的数据集,这些评论来自涵盖音乐、政治、体育、模特、影响者内容、性别歧视讨论和一般话题等多样类别的视频。四种模型(GPT-3.5 Turbo、GPT-4.1、Gemini 1.5 Pro和Claude 3 Opus)在两种模式下进行了测试:零样本模式和上下文增强模式。我们测量了精确率、召回率、F1分数、准确率和假阳性率。包含简短上下文片段平均将召回率提升了约0.12,并将F1分数提高了最多0.10,尽管有时会增加假阳性。最佳平衡来自上下文增强模式下的Gemini,达到了0.82的F1分数和0.82的准确率,而零样本GPT-4.1在精确率上领先且假警报最低。我们展示了添加最少上下文如何改善低资源环境下的有毒语言检测,并提出了实用策略,如改进提示设计和阈值校准。这些结果表明,仅提示设计就能为服务不足的巴尔干语言社区的有毒语言检测带来有意义的提升。
引用
@article{arxiv.2506.09992,
title = {Large Language Models for Toxic Language Detection in Low-Resource Balkan Languages},
author = {Amel Muminovic and Amela Kadric Muminovic},
journal= {arXiv preprint arXiv:2506.09992},
year = {2025}
}
备注
8 pages