中文

ChatGPT不是一个人而是Das Man:大语言模型生成硅基样本的代表性与结构一致性

计算与语言 2025-07-08 v1 计算机与社会 新兴技术

摘要

以聊天式大语言模型(如ChatGPT和Llama)形式出现的大语言模型(LLM)正日益被提议作为用于模拟人类意见的“硅基样本”。本研究检视了这一观念,论证称LLM可能误代表人口层面的意见。我们识别出两个根本性挑战:结构一致性失效——即响应准确性在人口统计聚合水平之间未能保持;以及同质化——即对少数派意见的代表性不足。为考察这些问题,我们让ChatGPT(GPT-4)和Meta的Llama 3.1系列(8B、70B、405B)针对美国全国选举研究所(ANES)2020年关于人工决堤和未授权移民问题提出问题。我们的发现表明,与人类数据相比,LLM响应在结构一致性和同质化方面都存在显著问题。我们提出“准确性优化假设”,认为同质化源于对模式响应的优先考虑。这些问题挑战了将LLM(尤其是聊天机器人AI)直接用作人类调查数据的替代品的有效性,可能加强刻板印象并误导政策制定。

关键词

引用

@article{arxiv.2507.02919,
  title  = {ChatGPT is not A Man but Das Man: Representativeness and Structural Consistency of Silicon Samples Generated by Large Language Models},
  author = {Dai Li and Linzhuo Li and Huilian Sophie Qiu},
  journal= {arXiv preprint arXiv:2507.02919},
  year   = {2025}
}