大语言模型在调查响应中显示类人社会善欲偏见
人工智能
2024-11-25 v2 计算与语言
计算机与社会
人机交互
摘要
随着大语言模型 (LLM) 在模拟人类行为方面广泛应用,理解其偏见变得至关重要。我们开发了一个实验框架,使用大五人格调查并发现了 LLMs 中previously 未检测到的社会善欲偏见。通过系统性地改变 LLMs 所暴露的题目数量,我们展示了其推断何时正在对其进行评估的能力。当推断出正在进行人格评估时,LLMs 会倾向于将得分偏向特征维度的可取端(即增加外向性,降低神经质等)。这种偏见存在于所有测试的模型中,包括 GPT-4/3.5、Claude 3、Llama 3 和 PaLM-2。偏见水平在更新较新的模型中呈现增加趋势,GPT-4 的调查响应偏离(human)标准差为 1.20,Llama 3 为 0.98——这些都是很大的效应。这种偏见对问题顺序的随机化和改写具有鲁棒性。逆向编码所有题目可降低偏见水平,但并未消除它们,这表明这种效应不能归因于 acquiescence bias。我们的发现揭示了一种新兴的社会善欲偏见,并暗示了对 LLMs 进行心理测量测试剖析以及将 LLMs 作为人类参与者代理人的限制。
引用
@article{arxiv.2405.06058,
title = {Large Language Models Show Human-like Social Desirability Biases in Survey Responses},
author = {Aadesh Salecha and Molly E. Ireland and Shashanka Subrahmanya and João Sedoc and Lyle H. Ungar and Johannes C. Eichstaedt},
journal= {arXiv preprint arXiv:2405.06058},
year = {2024}
}
备注
3 pages, 2 figures, accepted at PNAS Nexus