中文

PANDORA Talks:Reddit 上的性格与人口统计学特征

计算与语言 2021-06-09 v3 计算机与社会 社会与信息网络

摘要

性格与人口统计学变量在社会科学中十分重要,而在 NLP 中它们有助于可解释性的提升和社会偏见的消除。然而,同时带有性格与人口统计学标签的数据集十分匮乏。为此,我们提出 PANDORA,这是首个大规模 Reddit 评论数据集,为超过 1 万用户标注了三种性格模型(包括成熟的 Big 5 模型)以及人口统计学特征(年龄、性别和位置)。我们通过三个实验展示了该数据集的效用:利用其他性格模型中更易获取的数据预测 Big 5 特质,分析由心理-人口统计学变量引起的性别分类偏见,并基于心理学理论进行验证性与探索性分析。最后,我们给出了所有性格与人口统计学变量的基准预测模型。

关键词

引用

@article{arxiv.2004.04460,
  title  = {PANDORA Talks: Personality and Demographics on Reddit},
  author = {Matej Gjurković and Mladen Karan and Iva Vukojević and Mihaela Bošnjak and Jan Šnajder},
  journal= {arXiv preprint arXiv:2004.04460},
  year   = {2021}
}

备注

Proceedings of the Ninth International Workshop on Natural Language Processing for Social Media, NAACL 2021, https://www.aclweb.org/anthology/2021.socialnlp-1.12