SimBench:评估大型语言模型模拟人类行为能力的基准
计算与语言
2026-04-14 v4 人工智能
计算机与社会
机器学习
摘要
大型语言模型(LLM)模拟人类行为的潜力巨大,但仅在能够忠实反映真实人类行为时才能发挥作用。当前对模拟保真度的评估碎片化,基于定制任务和指标,形成一片不相容的结果。为此,我们引入 SimBench,第一个大规模、标准化的LLM模拟基准,为稳健、可重复的科学提供必要基础。通过统一覆盖道德决策、经济选择等任务的20个多样化数据集,以及来自大规模全球参与者池,SimBench 为提出关于LLM模拟何时、如何、为什么成功或失败的根本问题提供了必要条件。我们表明,当前最佳LLM实现了有意义但有限的模拟保真度(得分:40.80/100),模型规模呈对数线性比例增长,但推理时间计算量提升未显著提升。我们发现指令调优与模拟之间的权衡:指令调优改善了低熵(共识)问题的表现,但损害了高熵(多样)问题的表现。模型在模拟特定人口统计学群体时尤为吃力。最后,我们展示模拟能力与知识密集型推理能力(MMLU-Pro,r = 0.939)最强相关。通过使进步可衡量,我们旨在加速开发更可靠的LLM模拟器。
引用
@article{arxiv.2510.17516,
title = {SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors},
author = {Tiancheng Hu and Joachim Baumann and Lorenzo Lupo and Nigel Collier and Dirk Hovy and Paul Röttger},
journal= {arXiv preprint arXiv:2510.17516},
year = {2026}
}
备注
Accepted at ICLR 2026. Project Website: http://simbench.tiancheng.hu/ Data: https://huggingface.co/datasets/pitehu/SimBench