构建针对厌女与攻击性行为的多语言标注语料库
计算与语言
2020-03-18 v1
摘要
在本文中,我们讨论了作为研究与自动识别社交媒体上厌女与社群主义项目(ComMA 项目)一部分,构建印度英语、印地语和印度孟加拉语中厌女与攻击性行为的多语言标注语料库的工作。该数据集收集自 YouTube 视频下的评论,目前共包含超过 20,000 条评论。评论在两个层面上进行标注——攻击性(公开攻击性、隐蔽攻击性和非攻击性)与厌女(有性别指向和无性别指向)。我们描述了数据收集过程、用于标注的标签集,以及标注过程中面临的问题与挑战。最后,我们讨论了为开发三种语言中厌女分类器所进行的基线实验结果。
引用
@article{arxiv.2003.07428,
title = {Developing a Multilingual Annotated Corpus of Misogyny and Aggression},
author = {Shiladitya Bhattacharya and Siddharth Singh and Ritesh Kumar and Akanksha Bansal and Akash Bhagat and Yogesh Dawer and Bornini Lahiri and Atul Kr. Ojha},
journal= {arXiv preprint arXiv:2003.07428},
year = {2020}
}
备注
Submitted for review to Second Workshop on Trolling, Aggression and Cyberbullying (TRAC 2020)