中文

自消融 Transformer:更高可解释性,更低稀疏性

机器学习 2025-05-02 v1

摘要

机器学习中日益增长的直觉表明,稀疏性与可解释性之间存在联系。我们引入了一种新颖的自消融机制,以在语言 Transformer 的背景下先验地探究这种联系。我们的方法动态地强制执行 k-赢家通吃约束,迫使模型在神经元和注意力单元之间展示选择性激活。与分析已训练模型的事后方法不同,我们的方法将可解释性直接集成到模型训练中,从一开始就促进特征定位。通过在 TinyStories 数据集上训练小模型并采用可解释性测试,我们发现自消融导致了更局部化的电路、集中的特征表示和增加的神经元专业化,同时没有损害语言建模性能。令人惊讶的是,我们的方法还降低了整体稀疏性,表明自消融促进的是专业化而非广泛的不活跃。这揭示了稀疏性与可解释性之间复杂的相互作用,其中降低的全局稀疏性可以与增加的局部专业化共存,从而带来增强的可解释性。为了便于复现,我们在 https://github.com/keenanpepper/self-ablating-transformers 公开了我们的代码。

关键词

引用

@article{arxiv.2505.00509,
  title  = {Self-Ablating Transformers: More Interpretability, Less Sparsity},
  author = {Jeremias Ferrao and Luhan Mikaelson and Keenan Pepper and Natalia Perez-Campanero Antolin},
  journal= {arXiv preprint arXiv:2505.00509},
  year   = {2025}
}

备注

Poster Presentation at Building Trust Workshop at ICLR 2025