DravidianCodeMix:面向代码混合文本中德拉维达语言的情感分析与攻击性语言识别数据集
计算与语言
2022-05-17 v1
摘要
本文描述了为源自社交媒体评论的三种资源匮乏的德拉维达语言所构建的多语言人工标注数据集。该数据集针对总计超过60,000条YouTube评论进行了情感分析与攻击性语言识别标注。数据集包含约44,000条泰米尔语-英语评论、约7,000条卡纳达语-英语评论以及约20,000条马来语-英语评论。数据由志愿标注者人工标注,并在Krippendorff's alpha下具有较高标注者间一致性。由于数据集来自多语言国家的用户生成内容,其包含了所有类型的代码混合现象。我们还使用机器学习方法进行了基线实验,以在该数据集上建立基准。该数据集可在Github (https://github.com/bharathichezhiyan/DravidianCodeMix-Dataset) 与 Zenodo (https://zenodo.org/record/4750858#.YJtw0SYo_0M) 获取。
引用
@article{arxiv.2106.09460,
title = {DravidianCodeMix: Sentiment Analysis and Offensive Language Identification Dataset for Dravidian Languages in Code-Mixed Text},
author = {Bharathi Raja Chakravarthi and Ruba Priyadharshini and Vigneshwaran Muralidaran and Navya Jose and Shardul Suryawanshi and Elizabeth Sherly and John P. McCrae},
journal= {arXiv preprint arXiv:2106.09460},
year = {2022}
}
备注
36 pages