重新思考社交媒体上的仇恨言论检测:大语言模型能否取代传统模型?
计算与语言
2025-06-17 v1 计算机与社会
摘要
当代社交媒体上的仇恨言论检测因语言多样性以及在线话语的非正式性质而面临独特挑战。在涉及代码混合、转写以及文化细微表达的语境中,这些挑战进一步加剧。虽然微调后的变换器模型(如 BERT)已成为该任务的标准方法,但我们认为近期的大语言模型(LLM)不仅超越了它们,还从根本上重新定义了仇恨言论检测的格局。为支持这一主张,我们引入了 IndoHateMix,一个多样化、高质量的数据集,捕捉印度语境下的印地语-英语代码混合与转写,为评估模型在复杂多语言场景下的鲁棒性提供了真实基准。我们的广泛实验表明,最先进的大语言模型(如 LLaMA-3.1)始终优于针对该任务的 BERT 模型,即使在利用显著更少的数据进行微调的情况下亦是如此。凭借其优越的泛化能力和适应性,LLM 提供了一种应对多样化环境中在线仇恨言论的变革性方法。这引发了这样一个问题:未来研究应优先开发专用模型,还是应专注于策划更丰富、更多样的数据集以进一步增强 LLM 的有效性。
引用
@article{arxiv.2506.12744,
title = {Rethinking Hate Speech Detection on Social Media: Can LLMs Replace Traditional Models?},
author = {Daman Deep Singh and Ramanuj Bhattacharjee and Abhijnan Chakraborty},
journal= {arXiv preprint arXiv:2506.12744},
year = {2025}
}