中文

利用稀疏自编码器发现信念几何结构

机器学习 2026-04-06 v1 人工智能

摘要

理解内部表征的几何结构是机制可解释性的核心目标。先前的研究表明,在隐马尔可夫模型生成的序列上训练的变换器在其残差流中将概率信念状态编码为单纯形形状的几何结构,顶点对应于潜在生成状态。在自然文本上训练的大型语言模型是否发展出类似的几何表征仍然是一个开放问题。我们提出了一种在变换器表征中发现候选单纯形结构子空间的流程,结合了稀疏自编码器(SAE)、SAE 特征的 k 子空间聚类以及使用 AANet 进行单纯形拟合。我们在已知信念状态几何结构的多部分隐马尔可夫模型上验证了该流程。应用于 Gemma-2-9B 后,我们识别出 13 个表现出候选单纯形几何结构(K ≥ 3)的优先聚类。一个关键挑战是区分真实的信念状态编码与平铺伪影:潜在变量可以跨越单纯形子空间,但混合坐标不携带超出任何单个特征的预测信号。因此,我们采用重心预测作为主要的判别性检验。在 13 个优先聚类中,3 个在近顶点样本上表现出高度显著的优势(Wilcoxon p < 10⁻¹⁴),4 个在单纯形内部样本上表现出显著优势。共计 5 个不同的真实聚类至少通过了一项检验,而没有任何空聚类通过任何一项。其中一个聚类 768_596 还在数据集中取得了最高的因果引导分数。这是被动预测与主动干预唯一收敛的情况。我们将这些发现作为 Gemma-2-9B 表征空间中存在真实信念类几何结构的初步证据,并指出了确认这一解释所需的结构化评估。

关键词

引用

@article{arxiv.2604.02685,
  title  = {Finding Belief Geometries with Sparse Autoencoders},
  author = {Matthew Levinson},
  journal= {arXiv preprint arXiv:2604.02685},
  year   = {2026}
}