自消融 Transformer:更高可解释性,更低稀疏性
机器学习
2025-05-02 v1
摘要
机器学习中日益增长的直觉表明,稀疏性与可解释性之间存在联系。我们引入了一种新颖的自消融机制,以在语言 Transformer 的背景下先验地探究这种联系。我们的方法动态地强制执行 k-赢家通吃约束,迫使模型在神经元和注意力单元之间展示选择性激活。与分析已训练模型的事后方法不同,我们的方法将可解释性直接集成到模型训练中,从一开始就促进特征定位。通过在 TinyStories 数据集上训练小模型并采用可解释性测试,我们发现自消融导致了更局部化的电路、集中的特征表示和增加的神经元专业化,同时没有损害语言建模性能。令人惊讶的是,我们的方法还降低了整体稀疏性,表明自消融促进的是专业化而非广泛的不活跃。这揭示了稀疏性与可解释性之间复杂的相互作用,其中降低的全局稀疏性可以与增加的局部专业化共存,从而带来增强的可解释性。为了便于复现,我们在 https://github.com/keenanpepper/self-ablating-transformers 公开了我们的代码。
引用
@article{arxiv.2505.00509,
title = {Self-Ablating Transformers: More Interpretability, Less Sparsity},
author = {Jeremias Ferrao and Luhan Mikaelson and Keenan Pepper and Natalia Perez-Campanero Antolin},
journal= {arXiv preprint arXiv:2505.00509},
year = {2025}
}
备注
Poster Presentation at Building Trust Workshop at ICLR 2025