生成带有人口统计、立场、文明度与主题性标注的社交媒体语料库框架
计算与语言
2020-12-11 v1 计算机与社会
摘要
本文中,我们介绍一个为各类别标注社交媒体文本语料库的框架。由于社交媒体数据由个人生成,标注文本中的个人人口统计属性对于语料库的社会技术(socio-technical)分析十分重要。此外,在分析大型数据集时,我们常可标注一小部分数据样本,然后利用该样本训练预测模型以标注全部数据的相关类别。我们以关于学生贷款讨论的Facebook评论语料库为案例研究,该语料库被标注了性别、兵役状况、年龄段、政治倾向、种族、立场、主题性、新自由主义观点以及评论的文明度。我们在 https://github.com/socialmediaie/StudentDebtFbComments 发布了三个Facebook评论数据集以供进一步研究。
引用
@article{arxiv.2012.05444,
title = {A Framework for Generating Annotated Social Media Corpora with Demographics, Stance, Civility, and Topicality},
author = {Shubhanshu Mishra and Daniel Collier},
journal= {arXiv preprint arXiv:2012.05444},
year = {2020}
}
备注
Code at: https://github.com/socialmediaie/StudentDebtFbComments