利用大语言模型的基于翻译方法的多语言社交媒体仇恨言论检测
计算与语言
2025-06-11 v1 人工智能
机器学习
摘要
社交媒体平台是公共话语的关键空间,塑造观点和社区动态,但其广泛使用放大了有害内容,特别是仇恨言论,威胁在线安全和包容性。虽然仇恨言论检测在英语和西班牙语等语言中已被广泛研究,但乌尔都语仍未被充分探索,尤其是使用基于翻译的方法。为填补这一空白,我们引入了一个三语数据集,包含10,193条推文(英语3,834条、乌尔都语3,197条、西班牙语3,162条),通过关键词过滤收集,仇恨言论和非仇恨言论标签分布均衡(分别为4,849条和5,344条)。我们的方法利用注意力层作为基于Transformer的模型和大语言模型(LLMs)的前驱,以增强多语言仇恨言论检测的特征提取。对于非Transformer模型,我们使用TF-IDF进行特征提取。该数据集使用最先进模型进行基准测试,包括GPT-3.5 Turbo和Qwen 2.5 72B,以及传统机器学习模型如SVM和其他Transformer(如BERT、RoBERTa)。三位标注者遵循严格指南确保数据集质量,Fleiss' Kappa达到0.821。我们的方法将注意力层与GPT-3.5 Turbo和Qwen 2.5 72B集成,取得了强劲性能:英语(GPT-3.5 Turbo)宏F1分数为0.87,西班牙语(GPT-3.5 Turbo)为0.85,乌尔都语(Qwen 2.5 72B)为0.81,联合多语言模型(Qwen 2.5 72B)为0.88。这些结果相比SVM基线分别提升了8.75%(英语,从0.80)、8.97%(西班牙语,从0.78)、5.19%(乌尔都语,从0.77)和7.32%(联合多语言模型,从0.82)。我们的框架为多语言仇恨言论检测提供了稳健的解决方案,有助于全球更安全的数字社区建设。
引用
@article{arxiv.2506.08147,
title = {Multilingual Hate Speech Detection in Social Media Using Translation-Based Approaches with Large Language Models},
author = {Muhammad Usman and Muhammad Ahmad and M. Shahiki Tash and Irina Gelbukh and Rolando Quintero Tellez and Grigori Sidorov},
journal= {arXiv preprint arXiv:2506.08147},
year = {2025}
}