标准大语言模型中思维多样性的减弱
摘要
我们测试大语言模型(LLMs)是否可用于在社会科学研究中模拟人类被试。为此,我们使用OpenAI的text-davinci-003模型(俗称GPT3.5)对Many Labs 2复制项目中的14项研究进行复现。基于我们的预注册分析,我们发现,在可分析的八项研究中,我们的GPT样本复现了37.5%的原始结果和37.5%的Many Labs 2结果。然而,由于一种我们称之为“正确答案”效应的意外现象,我们无法分析其余六项研究。GPT3.5的不同运行在回答探究政治取向、经济偏好、判断与道德哲学的细微问题时,响应零或近乎零的变异:即给出所谓的“正确答案”。在一项探索性后续研究中,我们发现“正确答案”对更改提示前的人口统计细节具有鲁棒性。在另一项研究中,我们发现大多数(但非全部)“正确答案”对更改选项顺序具有鲁棒性。我们最引人注目的发现之一出现在对道德基础理论调查结果的复现中,我们发现GPT3.5在99.6%的案例中自认政治保守派,而在逆序条件下99.3%的案例中自认自由派。然而,自报的“GPT保守派”与“GPT自由派”均表现出右倾的道德基础。我们的结果对将LLMs作为社会科学中人类被试的通用替代的有效性提出质疑。我们的结果也引发担忧:假设由AI主导的未来可能面临思维多样性减弱的困境。
引用
@article{arxiv.2302.07267,
title = {Diminished Diversity-of-Thought in a Standard Large Language Model},
author = {Peter S. Park and Philipp Schoenegger and Chongyang Zhu},
journal= {arXiv preprint arXiv:2302.07267},
year = {2023}
}
备注
67 pages (42-page main text, 25-page SI); 12 visualizations (four tables and three figures in the main text, five figures in the SI); additional exploratory follow-up study varied the demographic details preceding the prompt; preregistered OSF database is available at https://osf.io/dzp8t/