大语言模型作为虚拟调查受访者:评估社会人口学响应生成
人工智能
2026-04-28 v2
摘要
基于问卷的调查是社会科学研究和公共政策制定的基础,但传统调查方法仍昂贵、耗时,且往往在规模上受限。尽管已有工作探索将大语言模型(LLM)作为虚拟调查受访者,但现有研究往往针对狭窄的任务场景,聚焦于单一社会学领域,或缺乏统一的评估框架,无法系统比较不同数据集和模型之间的表现。为此,我们引入两种互补的任务抽象:部分属性模拟(Partial Attribute Simulation, PAS),其中 LLM 从不完整的受访者轮廓中预测缺失属性;以及完整属性模拟(Full Attribute Simulation, FAS),其中 LLM 在零上下文或上下文增强条件下生成完整的合成数据集。这两种方法均被视为诊断性和探索性工具,而非人类数据收集的替代品。我们构建了 LLM-S³(Large Language Model-based Sociodemographic Survey Simulation),一个跨越 11 个真实公开数据集的基准,覆盖四个社会学领域,并在 GPT-3.5/4 Turbo 和 LLaMA 3.0/3.1-8B 上进行零-shot 和 few-shot 设置下的评估。我们的评估揭示了不同模型家族间一致的性能趋势,突显了结构化输出生成中的常见失效模式,并展示了上下文与提示设计如何影响模拟保真度。我们的代码和数据集可在: https://github.com/dart-lab-research/LLM-S-Cube-Benchmark 获取。
引用
@article{arxiv.2509.06337,
title = {Large Language Models as Virtual Survey Respondents: Evaluating Sociodemographic Response Generation},
author = {Jianpeng Zhao and Chenyu Yuan and Weiming Luo and Haoling Xie and Guangwei Zhang and Steven Jige Quan and Zixuan Yuan and Pengyang Wang and Denghui Zhang},
journal= {arXiv preprint arXiv:2509.06337},
year = {2026}
}
备注
Revised version, major corrections