中文

从数据统计到特征几何:相关性如何塑造叠加

机器学习 2026-03-11 v1 人工智能 计算机视觉与模式识别

摘要

机械可解释性的核心思想之一是,神经网络代表的特征数量超过其维数,通过在其上构成的叠加basis。此框架具有影响力,推动了稀疏自编码器等字典学习方法的出现。然而,叠加主要在特征稀疏且不相关的理想化环境中进行研究。在这些环境中,叠加通常被理解为引入必须通过 ReLU 等非线性函数最小化几何干扰并过滤出来的干扰,产生诸如规则多面体等局部结构。我们展示了此解释对现实数据不完整,通过引入包袱-词汇叠加 (BOWS),在叠加中编码互联网文本的二进制包袱-词汇表示。使用 BOWS,我们发现当特征相关时,干扰可以是构造性的而非仅是要被过滤的噪声。这通过根据共激活模式排列特征来实现,使活跃特征之间的干扰保持构造性,同时仍使用 ReLU 避免误报。我们显示,这种安排在使用权重衰减训练的模型中更为常见,自然产生语义聚类和循环结构,这些结构在真实语言模型中观察到却未被标准叠加图景解释。本文代码可在 https://github.com/LucasPrietoAl/correlations-feature-geometry 查找。

关键词

引用

@article{arxiv.2603.09972,
  title  = {From Data Statistics to Feature Geometry: How Correlations Shape Superposition},
  author = {Lucas Prieto and Edward Stevinson and Melih Barsbey and Tolga Birdal and Pedro A. M. Mediano},
  journal= {arXiv preprint arXiv:2603.09972},
  year   = {2026}
}