中文

面向泰米尔语代码混合 YouTube 评论与帖子的攻击性语言识别

计算与语言 2022-12-13 v2

摘要

社交媒体平台中的攻击性语言检测在过去几年中一直是一个活跃的研究领域。在非英语母语国家,社交媒体用户在其帖子/评论中大多使用代码混合形式的文本。这给攻击性内容识别任务带来了若干挑战,而考虑到泰米尔语可用的资源很少,这项任务变得更加困难。本研究展示了使用多种深度学习和迁移学习模型来检测 YouTube 上攻击性内容的广泛实验。我们提出了一种新颖且灵活的选择性翻译和音译技术方法,以从微调和集成多语言 Transformer 网络(如 BERT、DistilBERT 和 XLM-RoBERTa)中获得更好的结果。实验结果表明,ULMFiT 是该任务的最佳模型。对于这个泰米尔语代码混合数据集,表现最好的模型是 ULMFiT 和 mBERTBiLSTM,而不是更流行的迁移学习模型(如 DistilBERT 和 XLM-RoBERTa)以及混合深度学习模型。所提出的模型 ULMFiT 和 mBERTBiLSTM 取得了良好的结果,对于低资源语言中的有效攻击性言论识别具有前景。

关键词

引用

@article{arxiv.2108.10939,
  title  = {Towards Offensive Language Identification for Tamil Code-Mixed YouTube Comments and Posts},
  author = {Charangan Vasantharajan and Uthayasanker Thayasivam},
  journal= {arXiv preprint arXiv:2108.10939},
  year   = {2022}
}

备注

13 pages