大型语言模型能否取代人类受试者?对心理学与管理学情景实验的大规模复制研究
计算与语言
2025-06-23 v3 人工智能
综合经济学
经济学
摘要
人工智能 (AI) 正越来越多地被集成到科学研究中,尤其是在社会科学领域,而该领域的研究关键在于理解人类行为。大型语言模型 (LLM) 在 various psychological experiments 中展现出复制人类类似响应的潜力。我们进行了一项大规模研究,使用三种最先进的 LLM (GPT-4、Claude 3.5 Sonnet 和 DeepSeek v3) 复制了来自顶级社会科学期刊的 156 项心理学实验。我们的结果显示,尽管 LLMs 在主要效应 (73-81%) 和交互效应 (46-63%) 上表现出较高的复制率,但它们始终产生比人类研究更大的效应大小,其 Fisher Z 值约为人类研究的 2-3 倍。值得注意的是,对于涉及种族、性别和伦理等社会敏感话题的研究,LLMs 的复制率显著低于其他研究。当原始研究报告发现无效应应时,LLMs 以极高的频率 (68-83%) 产生显著结果——虽然这可能反映出数据更干净、噪声更少,如由更窄的置信区间所证明,但也表明可能存在效应大小的高估风险。我们的结果既展示了 LLMs 在心理学研究中的潜力与挑战,又为快速的假设验证和灵活的工具提供了高效方法,同时丰富而非取代传统的人类受试者研究,然而对于复杂的社会现象和文化敏感的研究问题,需要更细致的解释和人类验证。
引用
@article{arxiv.2409.00128,
title = {Can Large Language Models Replace Human Subjects? A Large-Scale Replication of Scenario-Based Experiments in Psychology and Management},
author = {Ziyan Cui and Ning Li and Huaikang Zhou},
journal= {arXiv preprint arXiv:2409.00128},
year = {2025}
}
备注
5 figures, 2 tables