中文

跨语言攻击性语言检测:基于 BERT 的社交媒体孟加拉语、阿萨姆语与博多语对话仇恨内容分析

计算与语言 2023-12-19 v1 机器学习

摘要

在当今时代,社交媒体作为首要的通信平台,为个人提供了表达推测、学术观点和反思的途径。不幸的是,这种自由往往伴随着负面影响,它助长了仇恨言论和攻击性内容的广泛传播,对我们的世界造成了有害影响。因此,从社交媒体领域识别并根除此类攻击性内容变得至关重要。本文深入探讨了 HASOC-2023 攻击性语言识别的全面结果和关键发现。主要重点在于细致检测孟加拉语、阿萨姆语和博多语语言领域内的仇恨言论,构成了任务 4:消灭仇恨(Annihilate Hates)的框架。在这项工作中,我们使用了 BERT 模型,包括 XML-Roberta、L3-cube、IndicBERT、BenglaBERT 和 BanglaHateBERT。研究结果令人鼓舞,表明在大多数情况下 XML-Roberta-lagre 的表现优于单语模型。我们的团队“TeamBD”在任务 4 的阿萨姆语中排名第 3,在孟加拉语中排名第 5。

关键词

引用

@article{arxiv.2312.10528,
  title  = {Cross-Linguistic Offensive Language Detection: BERT-Based Analysis of Bengali, Assamese, & Bodo Conversational Hateful Content from Social Media},
  author = {Jhuma Kabir Mim and Mourad Oussalah and Akash Singhal},
  journal= {arXiv preprint arXiv:2312.10528},
  year   = {2023}
}

备注

9 pages, 1 figure, 5 tables