中文

解析 Ullman 变体:为何 LLM 在 trivial 改变的错误信念任务中会失败?

计算与语言 2025-05-29 v2

摘要

近期的实证结果引发了关于大型语言模型 (LLM) 是否具备心理学 (Theory of Mind, ToM) 能力的讨论。虽然一些研究发现 LLM 在 ToM 评估(如错误信念任务)中表现出色,但其他研究则显示其性能对刺激的 trivial 改变并不稳健。在本文中,我们引入了 SCALPEL——一种用于逐步修改刺激以检验 LLM 失败原因的特定假设的方法,并将其应用于 unexpected contents 任务的 transparent-access 修改。我们的结果表明,LLM 往往表现不佳,主要是因为它们未能做出必需的常识推断,例如:看到透明容器意味着识别其内容。我们指出,虽然现代 LLM 已超越了纯粹的模式匹配,但它们仍不足以实现稳健的人类样 ToM。我们认为 SCALPEL 有助于认知科学家更细致地检查 LLM 的能力,并提供关于用于评估人类认知任务的替代机制的见解。

关键词

引用

@article{arxiv.2406.14737,
  title  = {Dissecting the Ullman Variations with a SCALPEL: Why do LLMs fail at Trivial Alterations to the False Belief Task?},
  author = {Zhiqiang Pi and Annapurna Vadaparty and Benjamin K. Bergen and Cameron R. Jones},
  journal= {arXiv preprint arXiv:2406.14737},
  year   = {2025}
}