中文

将心理测量测验题目作为推特用户人格画像模型的训练数据

计算与语言 2022-05-17 v3

摘要

社交媒体中的作者画像机器学习模型通常依赖于社交媒体用户填写的基于自我报告的心理测量测验(问卷)所获取的数据。这是一种昂贵但准确的数据收集策略。另一种成本较低但可能导致噪声更大、偏差更大的替代方案,是依赖从用户资料中公开可得的信息推断出的标签,例如自我报告的诊断结果或测验成绩。在本文中,我们探索第三种策略,即直接使用经过验证的心理测量测验题目语料库作为训练数据。心理测量测验题目通常由第一人称视角(例如“我很容易交朋友。”)的句子组成。此类测验题目语料库构成了“小数据”,但其在众多概念上的可得性是一种丰富资源。我们针对人格画像研究该方法,并评估在此类心理测量测验题目上微调的 BERT 分类器在五大人格特质(开放性、尽责性、外向性、宜人性、神经质)上的表现,分析各种数据增强策略在应对此类小语料库所带来的挑战方面的潜力。我们在公开可用的 Twitter 语料库上的评估显示,对于 5 种人格特质中的 4 种,其性能与领域内训练相当,且采用了基于 T5 的数据增强。

关键词

引用

@article{arxiv.2202.10415,
  title  = {Items from Psychometric Tests as Training Data for Personality Profiling Models of Twitter Users},
  author = {Anne Kreuter and Kai Sassenberg and Roman Klinger},
  journal= {arXiv preprint arXiv:2202.10415},
  year   = {2022}
}

备注

WASSA 2022 at ACL 2022, published at https://aclanthology.org/2022.wassa-1.35/ Please cite by using https://aclanthology.org/2022.wassa-1.35.bib