中文

跳跃前进:利用JumpReLU稀疏自编码器提高重建保真度

机器学习 2024-08-02 v3

摘要

稀疏自编码器是一种有前景的无监督方法,用于在语言模型的激活中识别因果相关且可解释的线性特征。为了对下游任务有用,稀疏自编码器需要忠实地分解语言模型的激活;然而,为了可解释,分解必须是稀疏的——这两个目标之间存在张力。在本文中,我们引入了JumpReLU稀疏自编码器,与门控和TopK稀疏自编码器等其他最新进展相比,它在Gemma 2 9B激活上,在给定稀疏度水平下实现了最先进的重建保真度。我们还通过人工和自动可解释性研究证明,这种改进并非以牺牲可解释性为代价。JumpReLU稀疏自编码器是对普通(ReLU)稀疏自编码器的简单修改——我们将ReLU替换为不连续的JumpReLU激活函数——并且训练和运行同样高效。通过以原则性的方式利用直通估计器,我们展示了尽管在稀疏自编码器的前向传播中引入了不连续的JumpReLU函数,如何有效地训练JumpReLU稀疏自编码器。类似地,我们使用直通估计器直接训练L0稀疏性,而不是在L1等代理目标上进行训练,从而避免了收缩等问题。

关键词

引用

@article{arxiv.2407.14435,
  title  = {Jumping Ahead: Improving Reconstruction Fidelity with JumpReLU Sparse Autoencoders},
  author = {Senthooran Rajamanoharan and Tom Lieberum and Nicolas Sonnerat and Arthur Conmy and Vikrant Varma and János Kramár and Neel Nanda},
  journal= {arXiv preprint arXiv:2407.14435},
  year   = {2024}
}

备注

v2: new appendix H comparing kernel functions & bug-fixes to pseudo-code in Appendix J v3: further bug-fix to pseudo-code in Appendix J