LLM模拟人类心理行为能力有限:心理测量分析
计算与语言
2024-05-14 v1 人工智能
计算机与社会
人机交互
摘要
大型语言模型(LLMs)的人类化响应促使社会科学家研究LLMs能否用于模拟实验、意见调查和调查中的人类参与者。该研究领域的核心问题在于通过提示它们回应标准化问卷来勾勒LLMs的心理轮廓。这种研究的矛盾发现是可以的,因为从LLMs的文本响应中映射出底层或潜在特征来进行问卷分析并不容易。为此,我们采用心理测量学,即心理测量的科学。在本研究中,我们提示OpenAI的旗舰模型GPT-3.5和GPT-4假设不同的人格并回应一系列标准化的人格 constructs 的测量。我们使用两种类型的persona描述:一种是通用的(四或五个随机的人描述),另一种是具体的(主要来自大型人类数据集的实际人 demographics)。我们发现,使用通用persona描述的GPT-4(但不是GPT-3.5)的响应显示出有前景的、尽管不完美的、类似于人类规范的心理测量特性。然而,当使用具体的人口统计学描述档案时,两个LLMs的数据显示出较差的心理测量特性。我们得出结论,目前,当LLMs被要求模拟硅人格时,其响应是潜在潜在特征的较差信号。因此,我们的工作对LLMs在多项选择题 answering任务中模拟individual-level人类行为的能力提出了疑虑。
引用
@article{arxiv.2405.07248,
title = {Limited Ability of LLMs to Simulate Human Psychological Behaviours: a Psychometric Analysis},
author = {Nikolay B Petrov and Gregory Serapio-García and Jason Rentfrow},
journal= {arXiv preprint arXiv:2405.07248},
year = {2024}
}