中文

评估大语言模型在心智理论任务中的表现

计算与语言 2024-11-06 v7 计算机与社会 人机交互

摘要

使用一套定制的错误信念任务对十一个大语言模型(LLMs)进行了评估,该套任务被视为测试人类心智理论(Theory of Mind, ToM)的黄金标准。该任务集包含 640 个提示,分布在 40 个不同的任务中,每个任务包含一个错误信念场景、三个紧密匹配的真实信念控制场景,以及所有四个场景的反向版本。要解决一个任务,模型需要正确回答所有八个场景中的 16 个提示。较小和较旧的模型未能解决任何任务;GPT-3-davinci-003(2022 年 11 月版)和 ChatGPT-3.5-turbo(2023 年 3 月版)解决了 20% 的任务;ChatGPT-4(2023 年 6 月版)解决了 75% 的任务,与过去研究中观察到的六岁儿童的表现相当。我们探讨了这些发现的潜在解释,包括一个引人入胜的可能性:即此前被认为人类独有的心智理论,可能作为大语言模型语言能力提升的副产品而自发涌现。

关键词

引用

@article{arxiv.2302.02083,
  title  = {Evaluating Large Language Models in Theory of Mind Tasks},
  author = {Michal Kosinski},
  journal= {arXiv preprint arXiv:2302.02083},
  year   = {2024}
}

备注

TRY RUNNING ToM EXPERIMENTS ON YOUR OWN: The code and tasks used in this study are available at Colab (https://colab.research.google.com/drive/1ZRtmw87CdA4xp24DNS_Ik_uA2ypaRnoU). Don't worry if you are not an expert coder, you should be able to run this code with no-to-minimum Python skills. Or copy-paste the tasks to ChatGPT's web interface. Proceedings of the National Academy of Sciences (PNAS) 2024