概念分配区:跨Transformer深度追踪概念形成
摘要
Transformer语言模型中的概念形成是深度扩展的过程,不是单层事件:概念在残差流的连续区域中逐渐显现。机械可解释性方法识别单层的最佳类分离层——"最佳层"——捕捉的是一个瞬时快照,而非整个过程本身。我们引入概念分配区(CAZ):概念可被可测量分离的深度区间,即其几何表达被分配的区域。我们通过三个层级指标(Separation、Concept Coherence、Concept Velocity)形式化CAZ,并推导无需人工层扫描即可实现的边界检测。CAZ不是一个概念:它是模型组织其几何以使概念可分离的深度区间。单个概念通常参与多个CAZ;多个概念可能共享一个。跨34个来自8个建构家族和7个概念的经验验证显示,分离曲线S(l)常呈多模态。一个评分检测器揭示"温和CAZ"——标准峰检测下看不见但在消除实验中在93-100%情形下具有因果活性的微妙分配区域(16个34个模型中的26个在伴随验证论文中)。该框架生成七个可测试预测;其中四个yield出明确裁决(两个不被支持,一个部分支持,一个被支持),一个其前提条件被数据所取代,两个处于低功率状态——在离开一个概念的交叉验证中,跨建构家族的对齐被确认为深度匹配而非单一。参考实现:rosetta_tools v1.3.1 (doi:10.5281/zenodo.20361433)。
关键词
引用
@article{arxiv.2605.24856,
title = {The Concept Allocation Zone: Tracking How Concepts Form Across Transformer Depth},
author = {James Henry},
journal= {arXiv preprint arXiv:2605.24856},
year = {2026}
}
备注
34 models, 8 architectural families, 7 concepts. Companion papers: GEM (arXiv forthcoming), CAZ Validation (arXiv forthcoming), PRH Validation (arXiv forthcoming). Code: https://github.com/jamesrahenry/Rosetta_Tools