多种心理空间的一种机制:语言模型中共用值槽上的共享路由器
计算与语言
2026-07-11 v1 机器学习
摘要
语言构建了现实之外的话语语境:一幅画、一种信念、一段记忆、一个假设。每一个都是一个心理空间,其中同一实体可以取不同的值,就像一朵花在现实中是红色的,但在肖像画中却是紫色的。形式语义学将这些语境区分开来,因为它们的逻辑不同(模态、时间、信念、描绘);Fauconnier的心理空间理论将它们视为一种空间构建操作。我们探究Transformer语言模型实现的是哪一种,并发现了Fauconnier统一理论的机制版本。该模型在整个清单中使用一种路由器/槽格式:一个可复用的值槽存储归属内容,一个可因果操作的路由器(空间索引)选择读取哪个空间。使用分布式对齐搜索训练的子空间来控制一种空间类型(反事实、信念、虚构或时间)也能控制其他类型,在三个模型家族上远高于随机基线;形式语义学将其标记为特殊情况的信念,并未被特别区分。该路由器是低秩的,与实体身份加性组合,并通过少数后期层头部起作用。另外两个结果表明该机制驱动推理并进行组合:一个在规则推导结论上训练的子空间翻转了模型的推断,同时与其报告的内容分离,而组合空间构建器则在共享槽上生成一个新的路由器。本文确立了跨类型的普遍性。一篇配套论文深入探讨了信念,因为它在哲学、心理学和语言学(认识论、心理理论和命题态度报告)中具有特殊地位。
引用
@article{arxiv.2607.10248,
title = {One mechanism for many mental spaces: a shared router over a value slot in language models},
author = {Oliver Steele and Jiangtao Wen and Yuxing Han},
journal= {arXiv preprint arXiv:2607.10248},
year = {2026}
}
备注
25 pages, 6 figures, 9 tables