中文

从表示几何视角看稀疏化与重构

机器学习 2025-05-29 v1

摘要

稀疏自编码器(SAEs)已成为机制可解释性的主要工具,旨在识别可解释的单语义特征。然而,稀疏编码是如何组织语言模型激活向量的表示的?这种组织范式与特征解耦以及重构性能之间存在什么关系?为了回答这些问题,我们提出了 SAEMA,通过观察沿潜在张量展开的模态张量所对应的对称半正定(SSPD)矩阵的秩随残差流中添加噪声水平的变化,来验证表示的分层结构。为了系统地研究稀疏编码如何改变表示结构,我们定义了局部表示和全局表示,证明它们通过合并相似的语义特征并引入额外维度来放大特征间的差异。此外,我们从优化角度对全局表示进行了干预,证明了其可分离性与重构性能之间存在显著的因果关系。本研究从表示几何的角度解释了稀疏性原理,并展示了表示结构变化对重构性能的影响。特别强调了理解表示和引入表示约束的必要性,为开发新的可解释工具和改进 SAEs 提供了实证参考。代码可在 \hyperlink{https://github.com/wenjie1835/SAERepGeo}{https://github.com/wenjie1835/SAERepGeo} 获取。

关键词

引用

@article{arxiv.2505.22506,
  title  = {Sparsification and Reconstruction from the Perspective of Representation Geometry},
  author = {Wenjie Sun and Bingzhe Wu and Zhile Yang and Chengke Wu},
  journal= {arXiv preprint arXiv:2505.22506},
  year   = {2025}
}

备注

24 pages, 5 figures