中文

Kronecker 分解提升稀疏自编码器的效率与可解释性

机器学习 2025-12-23 v3 计算与语言

摘要

稀疏自编码器(SAEs)通过将语言模型的隐藏状态分解为可解释的潜在方向,在解释这些隐藏状态方面展现了巨大潜力。然而,大规模训练和解释 SAEs 仍然具有挑战性,尤其是在使用大字典尺寸时。尽管解码器可以利用稀疏感知内核来提高效率,但编码器仍需要计算量大且输出维度大的线性运算。为解决这一问题,我们提出了 KronSAE,一种通过 Kronecker 积分解对潜在表示进行分解的新型架构,可大幅降低内存和计算开销。此外,我们引入了 mAND,一种近似二进制 AND 操作的可微激活函数,它提高了我们分解框架中的可解释性和性能。

关键词

引用

@article{arxiv.2505.22255,
  title  = {Kronecker Factorization Improves Efficiency and Interpretability of Sparse Autoencoders},
  author = {Vadim Kurochkin and Yaroslav Aksenov and Daniil Laptev and Daniil Gavrilov and Nikita Balagansky},
  journal= {arXiv preprint arXiv:2505.22255},
  year   = {2025}
}