中文

印度-雅利安语系中的仇恨言论与冒犯性内容检测:LSTM 与 Transformer 的较量

计算与语言 2023-12-12 v1

摘要

社交媒体平台为个人表达思想和经历提供了便捷的渠道,导致涵盖所有年龄段的用户生成数据大量涌入。虽然这些平台实现了自由表达,但它们也带来了重大挑战,包括仇恨言论和冒犯性内容的泛滥。这种不当语言破坏了客观的话语,可能导致辩论的极端化,最终威胁民主价值观。因此,各组织已采取措施监控和遏制辱骂行为,这需要自动化方法来识别可疑帖子。本文为英语和印度-雅利安语系仇恨言论与冒犯性内容识别(HASOC)2023 共享任务赛道做出贡献。我们团队 Z-AGI Labs 对五种不同语言(孟加拉语、阿萨姆语、博多语、僧伽罗语和古吉拉特语)的仇恨言论分类进行了全面的比较分析。我们的研究涵盖了广泛的预训练模型,包括 Bert 变体、XLM-R 和 LSTM 模型,以评估它们在这些语言中识别仇恨言论的性能。结果揭示了模型性能的有趣差异。值得注意的是,Bert Base Multilingual Cased 在各语言中均表现出色,在孟加拉语中取得了 0.67027 的 F1 分数,在阿萨姆语中取得了 0.70525 的 F1 分数。同时,它在博多语中以 0.83009 的优异 F1 分数显著优于其他模型。在僧伽罗语中,XLM-R 以 0.83493 的 F1 分数脱颖而出;而对于古吉拉特语,基于 LSTM 的自定义模型以 0.76601 的 F1 分数胜出。本研究为各种预训练模型在多语言环境下的仇恨言论检测适用性提供了宝贵见解。通过考虑每种语言的细微差别,我们的研究有助于为构建稳健的仇恨言论检测系统进行明智的模型选择。

关键词

引用

@article{arxiv.2312.05671,
  title  = {Hate Speech and Offensive Content Detection in Indo-Aryan Languages: A Battle of LSTM and Transformers},
  author = {Nikhil Narayan and Mrutyunjay Biswal and Pramod Goyal and Abhranta Panigrahi},
  journal= {arXiv preprint arXiv:2312.05671},
  year   = {2023}
}

备注

14 pages, 3 figures. Accepted Working Notes at HASOC-FIRE 2023, to be published in CEUR Working Notes of FIRE