中文

利用 Transformer 检测会话式码混推文中的仇恨言论

计算与语言 2021-12-21 v1 人工智能 机器学习

摘要

在互联网时代,社交媒体平台对所有人来说都易于访问,人们常常因其种姓、信仰、性别、宗教归属,甚至对某种观念的接受或排斥而遭受威胁、身份攻击、仇恨和欺凌。现有的仇恨言论检测工作主要将单条评论分类作为序列标注任务,往往未能考虑对话的上下文。对话的上下文在判定推文作者意图与情感时往往起着重要作用。本文描述了 MIDAS-IIITD 团队为 HASOC 2021 子任务 2 所提出的系统,这是首批专注于从 Twitter 上的印地语-英语码混对话中检测仇恨言论的共享任务之一。我们采用神经网络方法来解决该问题,利用 Transformer 的跨语言嵌入,并进一步针对音译印地语文本中的低资源仇恨言论分类进行微调。我们性能最佳的系统是 Indic-BERT、XLM-RoBERTa 和 Multilingual BERT 的硬投票集成,取得了 0.7253 的宏 F1 分数,在总排行榜上位居第一。

关键词

引用

@article{arxiv.2112.09986,
  title  = {Leveraging Transformers for Hate Speech Detection in Conversational Code-Mixed Tweets},
  author = {Zaki Mustafa Farooqi and Sreyan Ghosh and Rajiv Ratn Shah},
  journal= {arXiv preprint arXiv:2112.09986},
  year   = {2021}
}

备注

Accepted at FIRE 2021 - Hate Speech and offensive content detection (HASOC) Track