为何线性可解释性有效:架构约束下的不变子空间
机器学习
2026-02-11 v1 计算与语言
摘要
线性探针和稀疏自编码器一致从变换器表示中恢复有意义结构——为何简单的线性方法在深层非线性系统中会成功?我们指出这并非仅是经验性规律,而是架构必然性的结果:变换器通过线性界面(注意力 OV 电路、解嵌入矩阵)传递信息,任何通过此类界面解码的语义特征必须占据不变的线性子空间。我们将此形式化为“不变子空间必然性”定理,推导出“自引用属性”:标记直接提供其关联特征的几何方向,使无需标签数据或学习探针即可实现零样本语义结构识别。经验验证在八个分类任务和四个模型家族中均证实了类别标记与语义相关实例之间的对齐。我们的框架为为何线性可解释性方法有效提供了原则性架构解释,统一了线性探针和稀疏自编码器。
引用
@article{arxiv.2602.09783,
title = {Why Linear Interpretability Works: Invariant Subspaces as a Result of Architectural Constraints},
author = {Andres Saurez and Yousung Lee and Dongsoo Har},
journal= {arXiv preprint arXiv:2602.09783},
year = {2026}
}
备注
Submitted to ICML 2026. 19 pages, 13 figures