Kronecker 分解提升稀疏自编码器的效率与可解释性
机器学习
2025-12-23 v3 计算与语言
摘要
稀疏自编码器(SAEs)通过将语言模型的隐藏状态分解为可解释的潜在方向,在解释这些隐藏状态方面展现了巨大潜力。然而,大规模训练和解释 SAEs 仍然具有挑战性,尤其是在使用大字典尺寸时。尽管解码器可以利用稀疏感知内核来提高效率,但编码器仍需要计算量大且输出维度大的线性运算。为解决这一问题,我们提出了 KronSAE,一种通过 Kronecker 积分解对潜在表示进行分解的新型架构,可大幅降低内存和计算开销。此外,我们引入了 mAND,一种近似二进制 AND 操作的可微激活函数,它提高了我们分解框架中的可解释性和性能。
引用
@article{arxiv.2505.22255,
title = {Kronecker Factorization Improves Efficiency and Interpretability of Sparse Autoencoders},
author = {Vadim Kurochkin and Yaroslav Aksenov and Daniil Laptev and Daniil Gavrilov and Nikita Balagansky},
journal= {arXiv preprint arXiv:2505.22255},
year = {2025}
}