ChatGPT不是一个人而是Das Man:大语言模型生成硅基样本的代表性与结构一致性
计算与语言
2025-07-08 v1 计算机与社会
新兴技术
摘要
以聊天式大语言模型(如ChatGPT和Llama)形式出现的大语言模型(LLM)正日益被提议作为用于模拟人类意见的“硅基样本”。本研究检视了这一观念,论证称LLM可能误代表人口层面的意见。我们识别出两个根本性挑战:结构一致性失效——即响应准确性在人口统计聚合水平之间未能保持;以及同质化——即对少数派意见的代表性不足。为考察这些问题,我们让ChatGPT(GPT-4)和Meta的Llama 3.1系列(8B、70B、405B)针对美国全国选举研究所(ANES)2020年关于人工决堤和未授权移民问题提出问题。我们的发现表明,与人类数据相比,LLM响应在结构一致性和同质化方面都存在显著问题。我们提出“准确性优化假设”,认为同质化源于对模式响应的优先考虑。这些问题挑战了将LLM(尤其是聊天机器人AI)直接用作人类调查数据的替代品的有效性,可能加强刻板印象并误导政策制定。
引用
@article{arxiv.2507.02919,
title = {ChatGPT is not A Man but Das Man: Representativeness and Structural Consistency of Silicon Samples Generated by Large Language Models},
author = {Dai Li and Linzhuo Li and Huilian Sophie Qiu},
journal= {arXiv preprint arXiv:2507.02919},
year = {2025}
}