ComMA 数据集 V0.2:多语言社交媒体话语中的攻击性与偏见标注
计算与语言
2021-11-23 v1
摘要
在本文中,我们讨论了一个多语言数据集的开发,该数据集以分层、细粒度标签集标注,标记不同类型的攻击性及其发生的“语境”。此处语境由特定评论所在的对话线程,以及该评论相对于前一条评论所执行的“类型”话语角色来定义。此处讨论的初始数据集(作为 ComMA@ICON 共享任务的一部分发布)包含来自 YouTube、Facebook、Twitter 和 Telegram 等各种社交媒体平台收集的四种语言——Meitei、Bangla、Hindi 和印度英语——共计 15,000 条标注评论。如社交媒体网站常见,这些评论中有大量为多语言,多与英语代码混合。本文详细描述了用于标注的标签集,以及开发可用于标记各类攻击性与偏见(包括性别偏见、宗教不容忍(标签集中称教派偏见)、阶级/种姓偏见和族群/种族偏见)的多标签细粒度标签集的过程。我们也定义并讨论了用于标记评论所执行的不同话语角色的标签,如攻击、辩护等。我们还给出了该数据集的统计分析,以及使用所开发数据集构建自动攻击性识别系统的基线实验结果。
引用
@article{arxiv.2111.10390,
title = {The ComMA Dataset V0.2: Annotating Aggression and Bias in Multilingual Social Media Discourse},
author = {Ritesh Kumar and Enakshi Nandi and Laishram Niranjana Devi and Shyam Ratan and Siddharth Singh and Akash Bhagat and Yogesh Dawer},
journal= {arXiv preprint arXiv:2111.10390},
year = {2021}
}