中文

从原理出发推导无解码器稀疏自编码器

机器学习 2026-01-13 v1 机器学习

摘要

对 log-sum-exp(LSE)目标进行的梯度下降执行的是隐式的期望-最大化(EM):每个组件输出的梯度等于其责任。相同的理论预测在没有体积控制的情况下会发生崩溃,这类似于高斯混合模型中的 log-determinant。我们在具有 LSE 目标和 InfoMax 正则化(用于体积控制)的单层编码器中实现了该理论。实验确认了理论的预测。梯度-责任恒等式成立;仅用 LSE 会导致崩溃;方差防止死组件;去相关防止冗余。该模型表现出类似 EM 的优化动力学,其中损失值降低并不一定意味着特征更好,适应性优化器也没有优势。最终得到的无解码器模型学习可解释的混合组件,证明了隐式 EM 理论可以用于制定架构。

关键词

引用

@article{arxiv.2601.06478,
  title  = {Deriving Decoder-Free Sparse Autoencoders from First Principles},
  author = {Alan Oursland},
  journal= {arXiv preprint arXiv:2601.06478},
  year   = {2026}
}

备注

22 pages, 3 figures, 9 tables