SocioBench:使用大语言模型模拟社会调查中的人类行为
社会与信息网络
2025-10-14 v1 计算机与社会
摘要
大语言模型(LLMs)在模拟人类社交行为和互动方面显示出强大的潜力,但缺乏大规模、系统构建的基准用于评估其与真实社会态度的对齐程度。为弥合这一差距,我们引入Sociobench——一个来自国际社会调查计划(ISSP)年度收集的标准化调查数据的全面基准。该基准聚合了来自30多个国家、超过48万名真实受访者记录,涵盖10个社会学领域和40多个人口学属性。我们的实验表明,在复杂的调查情境中,LLMs仅能实现30-40%的准确率,并且在不同领域和人口学子群之间存在显著差异。这些发现凸显了当前LLM在调查情境中的几个局限性,包括足够的个体层面数据覆盖不足、情景多样性不足以及缺乏群体层面的建模。
关键词
引用
@article{arxiv.2510.11131,
title = {SocioBench: Modeling Human Behavior in Sociological Surveys with Large Language Models},
author = {Jia Wang and Ziyu Zhao and Tingjuntao Ni and Zhongyu Wei},
journal= {arXiv preprint arXiv:2510.11131},
year = {2025}
}
备注
Accepted by EMNLP 2025