#MeTooMA:与MeToo运动相关推文的多方面标注
计算与语言
2020-04-21 v2 社会与信息网络
摘要
在本文中,我们呈现了一个包含 9,973 条与MeToo运动相关推文的数据集,这些推文针对五种不同语言层面被人工标注:相关性、立场、仇恨言论、讽刺和对话行为。我们详细说明了数据收集与标注过程。由于标注者的领域专业知识和清晰的标注指引,标注具有非常高的标注者间一致性(0.79 至 0.93 k-alpha)。我们从地理分布、标签相关性和关键词方面对数据进行了分析。最后,我们给出了该数据集的一些潜在用例。我们期望该数据集能引起心理语言学家、社会语言学家和计算语言学家的极大兴趣,以研究围绕性骚扰等敏感问题的数字化动员社会运动的话语空间。
引用
@article{arxiv.1912.06927,
title = {#MeTooMA: Multi-Aspect Annotations of Tweets Related to the MeToo Movement},
author = {Akash Gautam and Puneet Mathur and Rakesh Gosangi and Debanjan Mahata and Ramit Sawhney and Rajiv Ratn Shah},
journal= {arXiv preprint arXiv:1912.06927},
year = {2020}
}
备注
Preprint of paper accepted at ICWSM 2020