几何演化图:从Transformer残差流中提取稳定概念探针
摘要
从Transformer残差流中提取的概念探针的可靠性取决于其提取层。在固定的后期层或分离得分函数峰值处进行探测的常见做法忽略了一个基本的结构特征:概念表征在其组装阶段经历显著的方向旋转,并且在特征性的交接层(位于主要概念分配区(CAZ)之后)之前不会稳定到一个固定方向。我们引入了几何演化图(GEM),它追踪概念通过残差流激活的完整方向轨迹,识别旋转停止的交接层,并从该层提取稳定的探针方向。在跨越70M到14B参数的23种架构和17种概念类型中,CAZ内入口到出口的余弦相似度平均值为0.233,表明CAZ入口处的探针方向不能可靠地预测出口处的探针方向。在391个概念×模型对(23个模型×17个概念)上的消融实验表明,GEM提取的探针在268/391次试验(68.5%)中至少与峰值层探针一样精确,并在259/391次试验(66.2%)中严格优于后者。架构差异显著:MHA模型在173/221次试验(78.3%)中倾向于交接层;GQA模型仅在56/119次试验(47.1%)中倾向于交接层。模型级Wilcoxon检验:W=214,N=23,p=0.010(单侧)。一个自适应消融宽度规则针对79/391个近最终层案例:它在60/79个触发案例(75.9%)中提高了探针质量,平均增益+7.44个百分点。方向特异性控制证实消融效应是概念方向特异性的:与随机方向消融相比,中位数抑制率为377倍(99.1%的概念方向优于所有10个随机种子)。参考实现:rosetta_tools v1.3.1(doi:10.5281/zenodo.20361433)。
引用
@article{arxiv.2605.25848,
title = {Geometric Evolution Maps: Extracting Stable Concept Probes from Transformer Residual Streams},
author = {James Henry},
journal= {arXiv preprint arXiv:2605.25848},
year = {2026}
}
备注
24 pages, 3 figures. Reference implementation: rosetta_tools v1.3.1 (doi:10.5281/zenodo.20361433)