人类心理测量问卷误判了 LLM 心理学:来自生成行为的证据
计算与语言
2026-04-06 v3 人工智能
摘要
使用为人类设计的心理测量问卷对大型语言模型(LLM)进行心理画像已变得普遍。然而,由此产生的画像是否反映了模型在与用户真实交互过程中表现出的心理特征仍不清楚。为了检验人类问卷误判 LLM 心理学的风险,我们比较了八个开源 LLM 的两类画像:来自成熟问卷(PVQ-40、PVQ-21、BFI-44、BFI-10)的自我报告 Likert 分数,以及对真实用户查询中带有价值或人格倾向的响应的生成概率分数。结果表明,这两种画像存在实质性差异,并提供了证据表明 LLM 对成熟问卷的响应反映的是期望行为而非稳定的心理结构,这挑战了先前工作中声称的 LLM 具有一致心理特质的观点。成熟问卷还存在夸大 LLM 人口统计学偏差的风险。我们的结果表明,在解释源自成熟问卷的心理画像时需谨慎,并指出基于生成的画像是 LLM 心理测量学更可靠的方法。
引用
@article{arxiv.2509.10078,
title = {Human Psychometric Questionnaires Mischaracterize LLM Psychology: Evidence from Generation Behavior},
author = {Woojung Song and Dongmin Choi and Yoonah Park and Jongwook Han and Yohan Jo},
journal= {arXiv preprint arXiv:2509.10078},
year = {2026}
}
备注
36 pages, 5 figures