印地语-英语混合数据的攻击性标注语料库
计算与语言
2018-03-28 v1
摘要
随着网络交互的增加,攻击性及网络钓鱼、网络欺凌、谩骂、仇恨言论等相关事件在全球范围内成倍增加。虽然欺凌或仇恨言论等大多数此类行为在互联网出现之前就已存在,但互联网的覆盖范围和广度赋予了它们前所未有的力量和影响力,影响了数十亿人的生活。因此,采取预防措施以保护网络用户,使网络总体上保持可行的通信和连接媒介,具有极其重要的意义。在本文中,我们讨论了攻击性标签集的开发,以及来自印度两个最受欢迎的社交网络和社交媒体平台 Twitter 和 Facebook 的印地语-英语混合数据的标注语料库。该语料库使用包含 3 个顶级标签和 10 个二级标签的层次化标签集进行标注。最终数据集包含约 18k 条推文和 21k 条 Facebook 评论,并已发布用于该领域的进一步研究。
引用
@article{arxiv.1803.09402,
title = {Aggression-annotated Corpus of Hindi-English Code-mixed Data},
author = {Ritesh Kumar and Aishwarya N. Reganti and Akshit Bhatia and Tushar Maheshwari},
journal= {arXiv preprint arXiv:1803.09402},
year = {2018}
}
备注
Pre-print version of paper accepted for presentation at 11th edition of the Language Resources and Evaluation Conference (LREC - 2018), 7-12 May 2018, Miyazaki (Japan)