稀疏自编码器的极限:理论框架与重加权补救方案
机器学习
2026-03-05 v2
摘要
稀疏自编码器(SAE)近期涌现为解读大型语言模型(LLM)所学习特征的强大工具。通过利用稀疏激活网络进行特征重构,SAE 旨在将复杂叠加的多义特征恢复为可解释的单义特征。尽管其应用广泛,但仍不清楚 SAE 在何种条件下才能完全恢复基准单义特征。本文提供了SAE的首个闭式解理论分析,揭示其除非基准特征极稀疏,否则通常难以完全恢复基准单义特征。为提高 SAE 在一般情况下的特征恢复效果,我们提出一种针对增强基准单义特征重建(而非观测多义特征)的重加权策略。我们进一步建立了所提出加权 SAE(WSAE)的理论权重选择原则。实验在多个设置下验证了我们的理论发现,表明 WSAE 在显著提升特征单义性和可解释性方面取得显著成果。
引用
@article{arxiv.2506.15963,
title = {On the Limits of Sparse Autoencoders: A Theoretical Framework and Reweighted Remedy},
author = {Jingyi Cui and Qi Zhang and Yifei Wang and Yisen Wang},
journal= {arXiv preprint arXiv:2506.15963},
year = {2026}
}
备注
Accepted to ICLR2026