中文

没有人的个性?对大语言模型大五人格测试的心理测量学批判

人机交互 2026-07-02 v1

摘要

人类人格量表正越来越多地被用于表征大语言模型(LLM)、比较系统并为下游治理主张提供依据。然而,这些量表是为人类开发并验证的,它们是否适用于 LLM 仍不清楚。我们对 LLM 中的大五人格测量进行了系统的心理测量学评估。我们提出三个研究问题:大五量表是否能 a) 恰当地描述 LLM,b) 捕捉模型间的个体差异,以及 c) 反映与人类人格一致的内部因素。我们评估了五个候选大五量表的内容效度,并将胜出的量表施测于跨越 49 个模型系列的 N = 244 个不同模型。首先,我们发现为 LLM 改编的大五条目可以达到足够的内容效度,而原始为人类开发的条目则不能。其次,大五量表未能捕捉 LLM 之间有意义的差异:我们发现模型间的变异性很低,仅占总得分方差的 3%。第三,LLM 的响应未能恢复大五因素结构,大五的四个方面坍缩为一个(r >= .92)。对基础模型和指令微调模型变体的直接比较表明,对齐训练系统地将大五得分向社会期望特质偏移。这些发现表明,大五得分在 LLM 中并未测量到等同于人类人格的构念。将人类人格框架应用于 LLM 会产生误导性表征,用于对 LLM 进行基准测试、比较和治理。我们强调需要为 LLM 开发专门的评估框架,而不是在未经验证的情况下采用人类构念。

关键词

引用

@article{arxiv.2607.02325,
  title  = {Personality Without Persons? A Psychometric Critique of Big Five Testing in Large Language Models},
  author = {Kim Zierahn and Cristina Cachero and Anna Korhonen and Nuria Oliver},
  journal= {arXiv preprint arXiv:2607.02325},
  year   = {2026}
}

备注

11 pages