中文

SimpleToM: 揭示 LLM 显式心智推理与隐式心智应用之间的差距

计算与语言 2026-03-03 v2 人工智能

摘要

大型语言模型(LLMs)正在被测试其“心智理论”(ToM)能力——即对自身和他人的心智状态进行归因的能力。然而,大多数评估仅停留在经典玩法故事或特定化任务中的显式信念归因上,留下了以下问题:LLMs 是否能够在多样化情景中隐式地应用这种知识来预测人类行为,或对观察到的行为进行判断。我们介绍 SimpleToM,这是一个推进 ToM 评估的基准测试,沿着两个新轴向发展。首先,它探测多层次的心智理论推理,从心智状态推理(显式 ToM)到行为预测与判断(应用 ToM)。其次,它将这些任务置于多样化、日常情景中——例如超市、医院、学校和办公室——在这些情景中,信息不对称自然出现(例如超市商品隐藏缺陷、提供者-患者交互中的信息不完整、或受限于受锁定设备的访问)。SimpleToM 包含简短的故事(例如:“Pringles 罐子里有霉变的薯片。Mary 在超市挑起这个罐子并走向收银台。”),每个故事都有三个问题,用于测试不同程度的 ToM 推理,要求模型预测:(a) 心智状态(“Mary 是否注意到霉变?”),(b) 行为(“Mary 会为薯片付款还是报告霉变?”),(c) 判断(“Mary 付款了。这是合理的吗?”)。实验结果显示,一个显著的差距:最先进的模型通常可靠地推断心智状态(a),但在对心智状态的知识进行二次预测时失败了,行为预测(b)的表现急剧下降,进一步地,行为判断(c)的表现更差。这揭示了 LLMs 在社交推理方面的关键脆弱性,即它们知道的内容(显式 ToM)与其能够隐式应用该知识进行预测的能力(应用 ToM)之间的差距。

关键词

引用

@article{arxiv.2410.13648,
  title  = {SimpleToM: Exposing the Gap between Explicit ToM Inference and Implicit ToM Application in LLMs},
  author = {Yuling Gu and Oyvind Tafjord and Hyunwoo Kim and Jared Moore and Ronan Le Bras and Peter Clark and Yejin Choi},
  journal= {arXiv preprint arXiv:2410.13648},
  year   = {2026}
}

备注

ICLR 2026