PANDORA Talks:Reddit 上的性格与人口统计学特征
计算与语言
2021-06-09 v3 计算机与社会
社会与信息网络
摘要
性格与人口统计学变量在社会科学中十分重要,而在 NLP 中它们有助于可解释性的提升和社会偏见的消除。然而,同时带有性格与人口统计学标签的数据集十分匮乏。为此,我们提出 PANDORA,这是首个大规模 Reddit 评论数据集,为超过 1 万用户标注了三种性格模型(包括成熟的 Big 5 模型)以及人口统计学特征(年龄、性别和位置)。我们通过三个实验展示了该数据集的效用:利用其他性格模型中更易获取的数据预测 Big 5 特质,分析由心理-人口统计学变量引起的性别分类偏见,并基于心理学理论进行验证性与探索性分析。最后,我们给出了所有性格与人口统计学变量的基准预测模型。
引用
@article{arxiv.2004.04460,
title = {PANDORA Talks: Personality and Demographics on Reddit},
author = {Matej Gjurković and Mladen Karan and Iva Vukojević and Mihaela Bošnjak and Jan Šnajder},
journal= {arXiv preprint arXiv:2004.04460},
year = {2021}
}
备注
Proceedings of the Ninth International Workshop on Natural Language Processing for Social Media, NAACL 2021, https://www.aclweb.org/anthology/2021.socialnlp-1.12