中文

分而治之:一种用于印地语敌对帖子检测的集成方法

计算与语言 2021-05-06 v1

摘要

近来 NLP 社区已开始关注敌对帖子检测这一挑战性任务。本文介绍了我们为 Constraint2021 上“印地语敌对帖子检测”共享任务所构建的系统。该共享任务的数据以印地语天城文提供,采集自 Twitter 和 Facebook。这是一个多标签多分类问题,每个数据实例被标注为以下五类中的一类或多类:虚假、仇恨、攻击性、诽谤和非敌对。我们提出了一种由基于 BERT 的分类器和统计分类器组成的两级架构来解决该问题。我们的团队“Albatross”在印地语敌对帖子检测子任务上取得了 0.9709 的粗粒度敌对性 F1 分数,并在 45 支队伍中名列第 2。我们的提交在总共 156 份提交中分别凭借 0.9709 和 0.9703 的粗粒度敌对性 F1 分数排名第 2 和第 3。我们的细粒度分数也令人鼓舞,并可通过进一步微调得以提升。代码已公开可用。

关键词

引用

@article{arxiv.2101.07973,
  title  = {Divide and Conquer: An Ensemble Approach for Hostile Post Detection in Hindi},
  author = {Varad Bhatnagar and Prince Kumar and Sairam Moghili and Pushpak Bhattacharyya},
  journal= {arXiv preprint arXiv:2101.07973},
  year   = {2021}
}