解析 Ullman 变体:为何 LLM 在 trivial 改变的错误信念任务中会失败?
计算与语言
2025-05-29 v2
摘要
近期的实证结果引发了关于大型语言模型 (LLM) 是否具备心理学 (Theory of Mind, ToM) 能力的讨论。虽然一些研究发现 LLM 在 ToM 评估(如错误信念任务)中表现出色,但其他研究则显示其性能对刺激的 trivial 改变并不稳健。在本文中,我们引入了 SCALPEL——一种用于逐步修改刺激以检验 LLM 失败原因的特定假设的方法,并将其应用于 unexpected contents 任务的 transparent-access 修改。我们的结果表明,LLM 往往表现不佳,主要是因为它们未能做出必需的常识推断,例如:看到透明容器意味着识别其内容。我们指出,虽然现代 LLM 已超越了纯粹的模式匹配,但它们仍不足以实现稳健的人类样 ToM。我们认为 SCALPEL 有助于认知科学家更细致地检查 LLM 的能力,并提供关于用于评估人类认知任务的替代机制的见解。
引用
@article{arxiv.2406.14737,
title = {Dissecting the Ullman Variations with a SCALPEL: Why do LLMs fail at Trivial Alterations to the False Belief Task?},
author = {Zhiqiang Pi and Annapurna Vadaparty and Benjamin K. Bergen and Cameron R. Jones},
journal= {arXiv preprint arXiv:2406.14737},
year = {2025}
}