用于识别多语言 YouTube 评论中恐同与跨性别恐惧症的数据集
计算与语言
2021-09-02 v1
摘要
社交媒体平台上滥用内容的日益泛滥对在线用户产生了负面影响。对女同性恋、男同性恋、跨性别者或双性恋者的恐惧、厌恶、不适或不信任被定义为恐同/跨性别恐惧症。恐同/跨性别恐惧言论是一种攻击性语言,可概括为针对 LGBT+ 人群的仇恨言论,近年来已引起越来越多的关注。网络恐同/跨性别恐惧是一个严重的社会问题,它会使在线平台对 LGBT+ 人群变得有毒且不友好,同时还试图消除平等、多样性和包容性。我们提出了一种新的用于网络恐同与跨性别恐惧的层次化分类体系,以及一个专家标注的数据集,该数据集将支持对恐同/跨性别恐惧内容进行自动识别。由于这是一个敏感问题,且我们先前发现未经培训众包标注者因文化及其他偏见难以诊断恐同现象,因此我们培训了标注者并为其提供了详尽的标注规则。该数据集包含 15,141 条标注的多语言评论。本文描述了数据集构建过程、数据定性分析及标注者间一致性。此外,我们为该数据集建立了基线模型。据我们所知,我们的数据集是首个此类创建的数据集。警告:本文包含明确的恐同、跨性别恐惧及刻板印象表述,可能会让部分读者感到不适。
引用
@article{arxiv.2109.00227,
title = {Dataset for Identification of Homophobia and Transophobia in Multilingual YouTube Comments},
author = {Bharathi Raja Chakravarthi and Ruba Priyadharshini and Rahul Ponnusamy and Prasanna Kumar Kumaresan and Kayalvizhi Sampath and Durairaj Thenmozhi and Sathiyaraj Thangasamy and Rajendran Nallathambi and John Phillip McCrae},
journal= {arXiv preprint arXiv:2109.00227},
year = {2021}
}
备注
44 Pages