中文

语言模型使用回溯机制追踪信念

计算与语言 2026-02-25 v3

摘要

语言模型(LM)如何表示角色的信念,尤其是当这些信念可能与现实不符时,这是理解 LM 理论心智(Theory of Mind,ToM)能力的核心问题。我们使用因果中介和抽象方法分析 LM 推理角色信念的能力。我们构建了一个数据集 CausalToM,包含简单故事,其中两个角色独立改变两个物体的状态,可能彼此 unaware。我们的调查发现,一种称为回溯机制(lookback mechanism)的普遍算法模式,使 LM 在必要时能够调用重要信息。LM 通过将每个角色-对象-状态三元组绑定在一起,将其参考信息(表示为排序 ID(Ordering IDs,OIs))在状态 token 的低秩子空间中共定位。当被问及角色对某物体状态的信念时,绑定回溯机制会检索正确的状态 OI,然后答案回溯检索对应的状态 token。当我们引入指定一个角色(不)被另一个角色看见的文本时,我们发现 LM 首先生成一个可见性 ID,编码观察者与被观察角色 OIs 之间的关系。在可见性回溯中,该 ID 用于检索有关被观察角色的信息并更新观察者的信念。我们的工作提供了关于信念跟踪机制的见解,为逆向工程 LM 中的理论心智推理迈出了一步。

关键词

引用

@article{arxiv.2505.14685,
  title  = {Language Models use Lookbacks to Track Beliefs},
  author = {Nikhil Prakash and Natalie Shapira and Arnab Sen Sharma and Christoph Riedl and Yonatan Belinkov and Tamar Rott Shaham and David Bau and Atticus Geiger},
  journal= {arXiv preprint arXiv:2505.14685},
  year   = {2026}
}

备注

38 pages, 50 figures. Code and data at https://belief.baulab.info/