中文

重新评估大语言模型的心智理论评测

人工智能 2025-03-03 v1 计算与语言

摘要

大语言模型(LLM)是否具备心智理论(Theory of Mind, ToM)——通常被定义为推理他人心理状态的能力——这一问题引发了科学界和公众的极大兴趣。然而,关于 LLM 是否具备 ToM 的证据褒贬不一,且近期评测的增长并未达成共识。在此,我们从认知科学中汲取灵感,重新评估 LLM 中 ToM 评测的现状。我们认为,关于 LLM 是否具有 ToM 产生分歧的一个主要原因在于:缺乏明确的共识,即究竟应该期望模型匹配人类行为,还是匹配这些行为背后的计算过程。我们还强调了当前评测可能偏离 ToM 能力“纯粹”测量的若干方式,这也加剧了困惑。最后,我们讨论了未来研究的几个方向,包括 ToM 与语用交际之间的关系,这有望推进我们对人工智能系统以及人类认知的理解。

关键词

引用

@article{arxiv.2502.21098,
  title  = {Re-evaluating Theory of Mind evaluation in large language models},
  author = {Jennifer Hu and Felix Sosa and Tomer Ullman},
  journal= {arXiv preprint arXiv:2502.21098},
  year   = {2025}
}

备注

under review