理解人工心智: 扰动任务中的推理与大语言模型
计算与语言
2026-02-26 v1 人工智能
摘要
心智理论(ToM)指的是智能体建模他人内在状态的能力。为检验大语言模型(LLM)是否具备真正的 ToM 能力, 本文通过对虚假信念任务进行扰动测试来考察其 ToM 鲁棒性, 并探讨链式思维(Chain-of-Thought, CoT)提示如何提升性能并解释 LLM 的决策过程。我们构建了一个手工设计且充分标注的 ToM 数据集, 包括经典和扰动版虚假信念任务, 对应的有效推理链空间, 推理链的后续忠诚度, 任务解决方案, 并提出评估推理链正确性以及最终答案是否忠于生成的 CoT 推理痕迹的指标。我们发现, 在所有被评估的 LLM 面对任务扰动时, ToM 能力会急剧下降, 这质疑了是否存在任何稳健的 ToM 形式。虽然 CoT 提示在整体上以忠诚的方式提升了 ToM 性能, 但意外的是, 它在某些扰动类别中会降低准确率, 这表明需要有选择地应用 CoT。
引用
@article{arxiv.2602.22072,
title = {Understanding Artificial Theory of Mind: Perturbed Tasks and Reasoning in Large Language Models},
author = {Christian Nickel and Laura Schrewe and Florian Mai and Lucie Flek},
journal= {arXiv preprint arXiv:2602.22072},
year = {2026}
}