中文

从不确定性量化视角考量:人类调查受访者与大语言模型需要多少样本?

统计方法学 2026-05-21 v5 人工智能 机器学习

摘要

大型语言模型(LLM)越来越被用于模拟调查响应,但合成数据可能与人类人口不一致,导致推断不可靠。我们发展了一个通用框架,将 LLM 模拟的响应转换为人类响应的人口参数的可靠置信区间,量化由人类-LLM 不一致性引起的不确定性。关键设计选择是模拟响应的数量:数量过多会产生过窄且覆盖率差的置信区间,数量过少则产生过宽且受随机噪声主导的置信区间。我们提出一种数据驱动的方法,自适应选择模拟样本量,以实现名义平均情况下的覆盖率,无论 LLM 的模拟保真度或置信区间构建程序如何。选定的样本量进一步表明,LLM 能代表的有效人类人口规模,提供了其模拟保真度的量化衡量标准。实验在真实调查数据集上进行,揭示了不同 LLM 和不同领域之间的异质化模拟保真度。

关键词

引用

@article{arxiv.2502.17773,
  title  = {How Many Human Survey Respondents is a Large Language Model Worth? An Uncertainty Quantification Perspective},
  author = {Chengpiao Huang and Yuhang Wu and Kaizheng Wang},
  journal= {arXiv preprint arXiv:2502.17773},
  year   = {2026}
}

备注

63 pages, 13 figures