中文

印地语-英语混合数据的攻击性标注语料库

计算与语言 2018-03-28 v1

摘要

随着网络交互的增加,攻击性及网络钓鱼、网络欺凌、谩骂、仇恨言论等相关事件在全球范围内成倍增加。虽然欺凌或仇恨言论等大多数此类行为在互联网出现之前就已存在,但互联网的覆盖范围和广度赋予了它们前所未有的力量和影响力,影响了数十亿人的生活。因此,采取预防措施以保护网络用户,使网络总体上保持可行的通信和连接媒介,具有极其重要的意义。在本文中,我们讨论了攻击性标签集的开发,以及来自印度两个最受欢迎的社交网络和社交媒体平台 Twitter 和 Facebook 的印地语-英语混合数据的标注语料库。该语料库使用包含 3 个顶级标签和 10 个二级标签的层次化标签集进行标注。最终数据集包含约 18k 条推文和 21k 条 Facebook 评论,并已发布用于该领域的进一步研究。

关键词

引用

@article{arxiv.1803.09402,
  title  = {Aggression-annotated Corpus of Hindi-English Code-mixed Data},
  author = {Ritesh Kumar and Aishwarya N. Reganti and Akshit Bhatia and Tushar Maheshwari},
  journal= {arXiv preprint arXiv:1803.09402},
  year   = {2018}
}

备注

Pre-print version of paper accepted for presentation at 11th edition of the Language Resources and Evaluation Conference (LREC - 2018), 7-12 May 2018, Miyazaki (Japan)