中文

面向真实世界人类行为模拟:在长时程、跨情景、异构行为轨迹上评估大语言模型

计算与语言 2026-05-22 v2 人工智能 机器学习

摘要

大型语言模型 (LLM) 的出现揭示了通用用户模拟器的潜力。然而,现有基准受限于孤立情景、狭窄动作空间或人工数据,无法捕捉真实人类行为的整体性。为弥合这一差距,我们介绍 OmniBehavior——第一个完全来自真实世界数据构建的用户模拟基准,将长时程、跨情景和异构行为模式整合到统一框架中。基于此基准,我们首先提供实证证据表明,具有孤立情景的先前数据集存在路径依赖性,而真实世界决策依赖于长期、跨情景的因果链。对最新 LLM 的广泛评估显示,当前模型在模拟这些复杂行为方面存在挑战,随着上下文窗口的扩大,性能甚至会停滞。关键在于,对模拟行为与真实行为的系统比较揭示了一种根本性偏差:LLM 倾向于趋向于积极的平均人,表现为过度活跃、人格同质化以及乌托邦式偏差。这导致个体差异和长尾行为的丢失,凸显了未来高保真模拟研究的关键方向。

关键词

引用

@article{arxiv.2604.08362,
  title  = {Towards Real-world Human Behavior Simulation: Benchmarking Large Language Models on Long-horizon, Cross-scenario, Heterogeneous Behavior Traces},
  author = {Jiawei Chen and Ruoxi Xu and Boxi Cao and Ruotong Pan and Yunfei Zhang and Yifei Hu and Yong Du and Tingting Gao and Yaojie Lu and Yingfei Sun and Xianpei Han and Le Sun and Xiangyu Wu and Hongyu Lin},
  journal= {arXiv preprint arXiv:2604.08362},
  year   = {2026}
}

备注

Project page: https://OmniBehavior.github.io