中文

基于Boosting与BERT模型的乌尔都语辱骂及威胁语言检测:一种对比方法

计算与语言 2021-12-01 v1

摘要

网络仇恨在许多社交媒体平台上日益受到关注。为解决此问题,不同的社交媒体平台已针对此类内容引入了审核政策。它们还雇佣审核员来检查违反审核政策的帖子并采取适当措施。辱骂语言研究领域的学者也开展了各种研究以更好地检测此类内容。尽管在英语辱骂语言检测方面已有广泛研究,但在印地语、乌尔都语等低资源语言的辱骂语言检测方面仍存在空白。在FIRE 2021共享任务——“HASOC-乌尔都语辱骂及威胁语言检测”中,组织者提出了乌尔都语辱骂语言检测数据集以及威胁语言检测。本文基于该共享任务,探索了多种机器学习模型,如XGboost、LGBM、m-BERT等基于BERT的模型,用于乌尔都语辱骂及威胁内容检测。我们观察到,专门在阿拉伯语辱骂语言数据集上训练的Transformer模型有助于获得最佳性能。我们的模型在辱骂和威胁内容检测中均获得第一,F1分数分别为0.88和0.54。

关键词

引用

@article{arxiv.2111.14830,
  title  = {Abusive and Threatening Language Detection in Urdu using Boosting based and BERT based models: A Comparative Approach},
  author = {Mithun Das and Somnath Banerjee and Punyajoy Saha},
  journal= {arXiv preprint arXiv:2111.14830},
  year   = {2021}
}

备注

Accepted in FIRE'21 (Track Abusive and Threatening Language Detection Task in Urdu). arXiv admin note: text overlap with arXiv:2111.13974