中文

大语言模型与地理语境下的仇恨言论检测评估

计算与语言 2025-02-28 v1 机器学习

摘要

社交媒体上仇恨言论的泛滥是给社会带来巨大冲击的严重问题:暴力 escalation、歧视和社会碎片化。仇恨言论检测问题本质上是多维度的,由于文化、语言和语境的复杂性以及对抗性操纵。本研究系统性地探讨了大语言模型在多语言数据集和多样化地理语境下检测仇恨言论的性能。我们的工作提出了一个新的三维评估框架:仇恨言论的二元分类、地理感知的语境检测以及对对抗性生成文本的鲁棒性。我们使用来自五个不同地区的 1,000 条评论数据集,评估了三个最先进的大语言模型:Llama2 (13b)、Codellama (7b) 和 DeepSeekCoder (6.7b)。Codellama 在二元分类召回率上表现最佳,达到 70.6%,F1 分数为 52.18%;而 DeepSeekCoder 在地理敏感性方面表现最佳,正确检测了 265 个地点中的 63 个。对抗鲁棒性测试也显示出显著的弱点;Llama2 对 62.5% 的被操纵样本进行了误分类。这些结果凸显了当前大语言模型在准确性、语境理解和鲁棒性之间的权衡。因此,本工作为开发具上下文感知能力的多语言仇恨言论检测系统奠定了基础,强调了关键优势和局限性,为未来研究和实际应用提供了可操作的见解。

关键词

引用

@article{arxiv.2502.19612,
  title  = {Evaluation of Hate Speech Detection Using Large Language Models and Geographical Contextualization},
  author = {Anwar Hossain Zahid and Monoshi Kumar Roy and Swarna Das},
  journal= {arXiv preprint arXiv:2502.19612},
  year   = {2025}
}

备注

6 pages, 2 figures