中文

随机鸽子还是和谐歌唱?测试五大领先大语言模型在复制人类调查方面的能力

计算机与社会 2026-05-13 v2 人工智能

摘要

人工智能生成的合成研究数据能多好地复制人类参与者的响应?越来越多的文献开始探讨这一问题,这对组织研究实践深刻影响。本文比较了420名硅谷程序员和开发者的人民调查,以及由五大领先生成式AI大语言模型(ChatGPT Thinking 5 Pro、Claude Sonnet 4.5 Pro plus Claude CoWork 1.123、Gemini Advanced 2.5 Pro、Incredible 1.0 和 DeepSeek 3.2)设计的旨在模拟真实调查者的合成调查数据。我们的发现表明,尽管AI代理产生了技术上可信的结果,但倾向于可复制性和和谐性,而非假设,均未能捕捉使人类调查具有价值的反直觉洞见。此外,所有模型的偏差归类一致,使真实数据成为异常值。我们的关键发现是,尽管领先的大语言模型日益被用于扩展、复制和取代人类调查响应,但这些进步仅显示出其愈发能力鸣佩传统智慧,和谐共鸣,而非揭示新发现。如果未来研究中使用合成受访者,我们需要更可靠的验证协议和报告标准,以明确何时何地才能负责任地使用合成调查数据,这一论文填补了这一空白。我们的结果表明,合成调查响应无法在组织内的真实人类社会信念方面产生有意义的建模,特别是在缺乏既有证据的情境下。我们得出结论,合成调查-based 研究不应被视为严格调查方法的替代品,而应被视为日益可靠的前/后场工作工具,用于识别社会假设、传统智慧以及其他关于研究对象的期望。

关键词

引用

@article{arxiv.2603.00059,
  title  = {Stochastic Parrots or Singing in Harmony? Testing Five Leading LLMs for their Ability to Replicate a Human Survey with Synthetic Data},
  author = {Jason Miklian and Kristian Hoelscher and John E. Katsos},
  journal= {arXiv preprint arXiv:2603.00059},
  year   = {2026}
}