大语言模型能否从真实世界对话中推断人格?
计算与语言
2025-07-22 v1
摘要
大型语言模型(LLM)如OpenAI的GPT-4和Meta的LLaMA为从开放式语言中进行可扩展人格评估提供了前景。然而,推断人格特征仍然具有挑战性,早期工作往往依赖合成数据或缺乏心理测量效度的社交媒体文本。我们引入了一个由555份半结构化访谈组成的真实世界基准,包含BFI-10自评分数,用于评估基于LLM的人格推断。测试了三种最先进的LLM(GPT-4.1 Mini、Meta-LLaMA和DeepSeek),使用零shot提示进行BFI-10项目预测,以及零shot和链式思维提示进行Big Five人格推断。所有模型表现出高test-retest可靠性,但构建效度有限:与真实得分的相关系数较弱(最大Pearson's ),评议人间一致性较低(Cohen's ),且预测倾向于中等或高水平的人格特征。链式思维提示和更长的输入上下文在分布层面略微改善了对齐度,但并未提高人格层面的准确性。这些结果凸显了当前基于LLM的人格推断中的局限性,并强调了为心理学应用开发证据基础方法的必要性。
引用
@article{arxiv.2507.14355,
title = {Can LLMs Infer Personality from Real World Conversations?},
author = {Jianfeng Zhu and Ruoming Jin and Karin G. Coifman},
journal= {arXiv preprint arXiv:2507.14355},
year = {2025}
}
备注
21 pages, 12 figures