中文

一种用于马拉地语攻击性语言检测的Twitter BERT方法

计算与语言 2022-12-21 v1

摘要

自动攻击性语言检测对于遏制仇恨言论的传播至关重要,尤其在社交媒体中。本文描述了我们在低资源印度语言马拉地语中攻击性语言识别方面的工作。该问题被构建为文本分类任务,以识别一条推文是否为攻击性。我们在该分类任务上评估了不同的单语和多语BERT模型,重点关注使用社交媒体数据集预训练的BERT模型。我们在HASOC 2022测试集上比较了MuRIL、MahaTweetBERT、MahaTweetBERT-Hateful和MahaBERT的性能。我们还探索了来自其他现有马拉地语仇恨言论语料库HASOC 2021和L3Cube-MahaHate的外部数据增强。MahaTweetBERT这一在马拉地语推文上预训练的BERT模型,当在组合数据集(HASOC 2021 + HASOC 2022 + MahaHate)上微调时,以HASOC 2022测试集上98.43的F1分数优于所有模型。借此,我们还提供了在HASOC 2022 / MOLD v2测试集上的新SOTA结果。

关键词

引用

@article{arxiv.2212.10039,
  title  = {A Twitter BERT Approach for Offensive Language Detection in Marathi},
  author = {Tanmay Chavan and Shantanu Patankar and Aditya Kane and Omkar Gokhale and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2212.10039},
  year   = {2022}
}