线性质心假设:由局部专家学习的特征作为方向
机器学习
2026-05-11 v2
摘要
线性表示假设(LRH)将训练深度网络(DN)的特征标识为激活空间中的线性方向,即中间层输出空间。这种表征将输入-输出图从DN中解耦出来,独立于特征方向在激活空间中的组织。我们引入线性质心假设(LCH),该假设将特征标识为DN质心空间中的线性方向——其中任何向量都表示一个质心或局部仿射专家( characterize 所学输入-输出图的 DN 的总结,例如对于分段仿射 DN,或者对于像变换器这样的光滑 DN 的近似)。我们展示,用质心替换中间激活可作为标准可解释性工具的功能性下降替代方案。经验上,此变更在 DINO ViTs 上产生更稀疏、更具下游实用性的特征字典,抑制受控任务中的伪导向,恢复 GPT2-Large 中的可解释电路,并产生可靠的梯度基盾图。LCH 将字典、探针、电路和盲点图统一为单个几何对象,基于网络的输入-输出图——使可解释性在构建时而非事后是机械的。
引用
@article{arxiv.2604.11962,
title = {The Linear Centroids Hypothesis: Features as Directions Learned by Local Experts},
author = {Thomas Walker and Ahmed Imtiaz Humayun and Randall Balestriero and Richard Baraniuk},
journal= {arXiv preprint arXiv:2604.11962},
year = {2026}
}
备注
23 pages, 17 figures