跨语言攻击性语言检测:基于 BERT 的社交媒体孟加拉语、阿萨姆语与博多语对话仇恨内容分析
计算与语言
2023-12-19 v1 机器学习
摘要
在当今时代,社交媒体作为首要的通信平台,为个人提供了表达推测、学术观点和反思的途径。不幸的是,这种自由往往伴随着负面影响,它助长了仇恨言论和攻击性内容的广泛传播,对我们的世界造成了有害影响。因此,从社交媒体领域识别并根除此类攻击性内容变得至关重要。本文深入探讨了 HASOC-2023 攻击性语言识别的全面结果和关键发现。主要重点在于细致检测孟加拉语、阿萨姆语和博多语语言领域内的仇恨言论,构成了任务 4:消灭仇恨(Annihilate Hates)的框架。在这项工作中,我们使用了 BERT 模型,包括 XML-Roberta、L3-cube、IndicBERT、BenglaBERT 和 BanglaHateBERT。研究结果令人鼓舞,表明在大多数情况下 XML-Roberta-lagre 的表现优于单语模型。我们的团队“TeamBD”在任务 4 的阿萨姆语中排名第 3,在孟加拉语中排名第 5。
引用
@article{arxiv.2312.10528,
title = {Cross-Linguistic Offensive Language Detection: BERT-Based Analysis of Bengali, Assamese, & Bodo Conversational Hateful Content from Social Media},
author = {Jhuma Kabir Mim and Mourad Oussalah and Akash Singhal},
journal= {arXiv preprint arXiv:2312.10528},
year = {2023}
}
备注
9 pages, 1 figure, 5 tables