中文

This human study did not involve human subjects: Validating LLM simulations as behavioral evidence

人工智能 2026-02-18 v1

摘要

越来越多的文献使用大型语言模型(LLM)作为合成参与者,以生成来自社会科学实验中近乎即时响应的成本效益高的行为。然而,对于此类模拟是否支持对人类行为的有效推断,缺乏明确指导。我们对两种获取人类行为有效因果效应估计的策略进行对比,并阐明每种策略适用于探索性与确认性研究时的假设条件。启发式方法寻求通过提示工程、模型微调和其他旨在减少 LLM 引起的不准确性的修复策略,建立模拟行为与观察人类行为的可互换性。虽然对许多探索性任务有用,但启发式方法缺乏通常要求的确认性研究的形式统计保证。相比之下,统计校准将辅助人类数据与统计调整相结合,以弥补观察响应与模拟响应之间的差异。在明确的假设下,统计校准可保持有效性,并在成本较低的情况下提供对因果效应更精确的估计,这些估计不依赖solely依赖于人类参与者的实验。然而,两种方法的潜力取决于 LLM 如何逼近相关人群。我们考虑当研究者仅关注将 LLM 替代作为研究中人类参与者时会忽视的机会。

关键词

引用

@article{arxiv.2602.15785,
  title  = {This human study did not involve human subjects: Validating LLM simulations as behavioral evidence},
  author = {Jessica Hullman and David Broska and Huaman Sun and Aaron Shaw},
  journal= {arXiv preprint arXiv:2602.15785},
  year   = {2026}
}