中文

面向动态心智理论:评估 LLM 对人类状态temporal演变的适应性

计算与语言 2025-06-10 v2 计算机与社会

摘要

随着大型语言模型 (LLM) 日益参与人类-人工智能互动,评估其心智理论 (ToM) 能力 —— 尤其是跟踪动态心智状态的能力 —— 变得至关重要。虽然现有的基准测试评估了基础的心智理论能力,但主要聚焦于静态的心智状态快照,忽略了构成真实世界社交互动的temporal演变。我们提出了 \textsc{DynToM},一个新颖的基准测试,专门用于评估 LLM 理解和跟踪心智状态在相互关联情境中的temporal progression。通过一个系统化的四步框架,我们生成了 1,100 个社交情境,包含 5,500 个情境和 78,100 个问题,每个问题都经过验证确保真实性和质量。我们对十个最先进的 LLM 进行了全面评估,发现其平均表现在跟踪和推理心智状态的变化时,低于人类的 44.7%,表现显著下降。这种差距凸显了当前 LLM 在建模人类心智状态dynamic本质方面的根本性局限。

关键词

引用

@article{arxiv.2505.17663,
  title  = {Towards Dynamic Theory of Mind: Evaluating LLM Adaptation to Temporal Evolution of Human States},
  author = {Yang Xiao and Jiashuo Wang and Qiancheng Xu and Changhe Song and Chunpu Xu and Yi Cheng and Wenjie Li and Pengfei Liu},
  journal= {arXiv preprint arXiv:2505.17663},
  year   = {2025}
}

备注

Accepted by ACL 2025 Main Conference