中文

SOLID:用于攻击性语言识别的大规模半监督数据集

计算与语言 2021-09-27 v2

摘要

社交媒体中攻击性内容的广泛使用导致了大量关于检测仇恨言论、网络欺凌和网络攻击性语言的研究。近期工作提出了OLID数据集,该数据集遵循一种攻击性语言识别的分类体系,为理解攻击性消息的类型和目标提供了有意义的信息。然而,其规模有限,并且由于使用关键词收集,可能偏向于攻击性语言。在本工作中,我们提出了扩展数据集SOLID,其中以更原则性的方式收集推文。SOLID包含超过九百万条以半监督方式标注的英文推文。我们证明,将SOLID与OLID结合使用,可为两种不同的模型在OLID测试集上带来可观的性能提升,尤其是在分类体系的较低层级上。

关键词

引用

@article{arxiv.2004.14454,
  title  = {SOLID: A Large-Scale Semi-Supervised Dataset for Offensive Language Identification},
  author = {Sara Rosenthal and Pepa Atanasova and Georgi Karadzhov and Marcos Zampieri and Preslav Nakov},
  journal= {arXiv preprint arXiv:2004.14454},
  year   = {2021}
}

备注

offensive language, hate speech, cyberbullying, cyber-aggression, taxonomy for offensive language identification