中文

Group-SAE:通过层分组高效训练大型语言模型的稀疏自编码器

计算与语言 2025-09-23 v2 人工智能

摘要

稀疏自编码器(SAE)最近被用作一种有前景的无监督方法,用于理解大型语言模型(LLM)各层的表示。然而,随着模型规模和复杂性的增长,训练稀疏自编码器的计算量很大,因为通常需要为每个模型层训练一个稀疏自编码器。为了解决这一限制,我们提出了 Group-SAE,一种训练稀疏自编码器的新策略。我们的方法考虑了连续层之间残差流表示的相似性,将相似的层分组,并为每组训练一个单一的稀疏自编码器。为了平衡效率与性能之间的权衡,我们进一步引入了 AMAD(平均最大角距离),这是一个基于各层表示相似性来指导选择最佳组数的经验指标。在 Pythia 系列模型上的实验表明,我们的方法显著加速了训练,同时与逐层训练的基线稀疏自编码器相比,对重建质量的影响最小,并且在下游任务性能和可解释性方面具有可比性。该方法为现代大型语言模型中训练稀疏自编码器提供了一种高效且可扩展的策略。

关键词

引用

@article{arxiv.2410.21508,
  title  = {Group-SAE: Efficient Training of Sparse Autoencoders for Large Language Models via Layer Groups},
  author = {Davide Ghilardi and Federico Belotti and Marco Molinari and Tao Ma and Matteo Palmonari},
  journal= {arXiv preprint arXiv:2410.21508},
  year   = {2025}
}

备注

Accepted version at EMNLP'25