中文

Transformer 嵌入空间中的认知状态几何组织

计算与语言 2026-04-07 v2 机器学习

摘要

近期研究表明,基于 Transformer 的语言模型在其嵌入空间中学习到了丰富的几何结构。本文探讨句子嵌入是否表现出与人类可解释认知或心理属性对齐的结构化几何组织。我们构建了一个包含 480 条自然语言句子的数据集,标注了连续能量分数(范围从 -5 到 +5)以及涵盖七个有序认知标注层级的离散标签,旨在捕捉从高度受限或反应性表达向更连贯和整合性认知状态的梯度过渡。使用来自多个 Transformer 模型的固定句子嵌入,我们评估了这些标注通过线性和浅层非线性探针的可恢复性。在所有模型中,连续能量分数和层级标签均可被可靠解码,线性探针已捕获相当大的结构。为评估统计显著性,我们进行了非参数置换检验,对标签进行随机化,显示探针性能在回归和分类原假设下均显著高于随机水平。定性分析通过 UMAP 可视化和层级级别混淆矩阵进一步揭示,存在一致的低到高梯度,且主要为相邻层级之间的局部混淆。综上,这些结果表明,Transformer 嵌入空间 exhibits 统计显著的几何组织,对齐了标注的认知结构。

关键词

引用

@article{arxiv.2512.22227,
  title  = {Geometric Organization of Cognitive States in Transformer Embedding Spaces},
  author = {Sophie Zhao},
  journal= {arXiv preprint arXiv:2512.22227},
  year   = {2026}
}