中文

信念-现实分离存在于语言模型共享价值槽上的路由中

计算与语言 2026-07-11 v1 机器学习

摘要

能力强大的语言模型将角色所相信的与真实情况区分开来:当被告知“安娜相信杯子是蓝色的;实际上它是红色的”时,关于安娜会回答蓝色,关于世界会回答红色。这种分离在计算中位于何处?我们表明,它依赖于两个位置上的两个可分离机制。一个通用的价值槽绑定被归因的价值。查询位置上的一个路由器选择查询读取哪个框架,是角色的信念还是现实。两条路径填充该槽:一条是断言信念,其价值由文本提供,直接绑定;另一条是派生信念,其价值必须从角色能看到的内容推断,通过一个可见性门控的回看机制到达。在任一路径上训练的子空间可以引导另一条路径,并且只有派生路径依赖于所描述的可见性。槽本身不携带信念-现实标签:干预它移动现实读出的程度与移动信念读出的程度相同。分离反而存在于一对解耦的路由子空间中,它们在框架之间翻转查询而不注入供体价值。这些结果在三种架构上成立,使用的刺激排除了心智理论基准捷径的干扰;这种行为本身在五个模型家族中于 3B 到 7B 之间出现。本文深入探讨了单一的信念-现实轴;一篇配套论文表明,相同的槽和路由器格式在句子可以打开的其他非实际语境(反事实、虚构、时间)中也是共享的。

关键词

引用

@article{arxiv.2607.11945,
  title  = {Belief-reality separation lives in routing over a shared value slot in language models},
  author = {Oliver Steele and Jiangtao Wen and Yuxing Han},
  journal= {arXiv preprint arXiv:2607.11945},
  year   = {2026}
}

备注

21 pages, 6 figures, 6 tables