中文

稀疏自编码器的极限:理论框架与重加权补救方案

机器学习 2026-03-05 v2

摘要

稀疏自编码器(SAE)近期涌现为解读大型语言模型(LLM)所学习特征的强大工具。通过利用稀疏激活网络进行特征重构,SAE 旨在将复杂叠加的多义特征恢复为可解释的单义特征。尽管其应用广泛,但仍不清楚 SAE 在何种条件下才能完全恢复基准单义特征。本文提供了SAE的首个闭式解理论分析,揭示其除非基准特征极稀疏,否则通常难以完全恢复基准单义特征。为提高 SAE 在一般情况下的特征恢复效果,我们提出一种针对增强基准单义特征重建(而非观测多义特征)的重加权策略。我们进一步建立了所提出加权 SAE(WSAE)的理论权重选择原则。实验在多个设置下验证了我们的理论发现,表明 WSAE 在显著提升特征单义性和可解释性方面取得显著成果。

关键词

引用

@article{arxiv.2506.15963,
  title  = {On the Limits of Sparse Autoencoders: A Theoretical Framework and Reweighted Remedy},
  author = {Jingyi Cui and Qi Zhang and Yifei Wang and Yisen Wang},
  journal= {arXiv preprint arXiv:2506.15963},
  year   = {2026}
}

备注

Accepted to ICLR2026