个人文本语料库预测开放性、兴趣、知识和教育水平
计算与语言
2024-04-02 v1 机器学习
摘要
本文检验了开放性人格维度是否可以从个人谷歌搜索历史中预测。通过网络爬虫,我们从214名参与者生成了个人文本语料库(IC),平均包含500万个词元。我们训练了word2vec模型,并利用每个IC与标签词(源自人格的词汇学方法)的相似性。这些IC-标签词相似性被用作神经模型中的预测特征。在训练和验证中,我们使用了179名参与者,并保留了一个包含35名参与者的测试样本。我们进行了网格搜索,改变预测特征数量、隐藏单元和提升因子。模型选择标准使用验证样本中的R²,并对训练与验证之间的绝对R²差异进行惩罚。所选神经模型解释了测试样本中35%的开放性方差,而具有相同架构的集成模型通常为智力兴趣、人文学科知识和教育水平提供更稳定的预测。最后,学习曲线分析表明,大约需要500名训练参与者才能实现可泛化的预测。我们讨论了个人文本语料库作为基于调查的心理诊断的补充或替代方案。
引用
@article{arxiv.2404.00165,
title = {Individual Text Corpora Predict Openness, Interests, Knowledge and Level of Education},
author = {Markus J. Hofmann and Markus T. Jansen and Christoph Wigbels and Benny Briesemeister and Arthur M. Jacobs},
journal= {arXiv preprint arXiv:2404.00165},
year = {2024}
}
备注
Proceedings of the 8th workshop on Cognitive Aspects of the Lexicon (CogALex-VIII), LREC/Coling 2024