中文

大语言模型离数字孪生人还能有多远?基于人物画像的行为链模拟基准测试

计算与语言 2025-07-22 v2

摘要

最近,大语言模型因其作为人类数字孪生体的潜力受到跨学科学术界的广泛关注——这些虚拟代理旨在复制 individual 的行为, autonomously 执行决策、问题解决和推理等任务。然而,现有的评估主要聚焦于对话模拟,忽略了人类行为模拟,这对于数字孪生体至关重要。为填补这一空白,我们引入 BehaviorChain——首个评估大语言模型模拟连续人类行为能力的基准测试。BehaviorChain 包含多样化的高质量、基于人物画像的行为链,总计 15,846 种独立行为,覆盖 1,001 个独特人物,每个人物都有详细的历史记录和概要元数据。进行评估时,我们将人物元数据集成到大语言模型中,并利用它们在 BehaviorChain 提供的动态情景中逐步推断情境下合适的行为。综合评估结果表明,即便是最先进的模型也在准确模拟连续人类行为方面仍存在显著挑战。

关键词

引用

@article{arxiv.2502.14642,
  title  = {How Far are LLMs from Being Our Digital Twins? A Benchmark for Persona-Based Behavior Chain Simulation},
  author = {Rui Li and Heming Xia and Xinfeng Yuan and Qingxiu Dong and Lei Sha and Wenjie Li and Zhifang Sui},
  journal= {arXiv preprint arXiv:2502.14642},
  year   = {2025}
}

备注

ACL 2025 Findings