基于端到端稀疏字典学习识别功能重要特征
机器学习
2024-05-27 v2 人工智能
摘要
识别神经网络学习到的特征是机制可解释性的一项核心挑战。稀疏自编码器通过学习一个稀疏且过完备的字典来重构网络的内部激活,已被用于识别这些特征。然而,SAEs 可能更多学习到的是数据集的结构,而非网络的计算结构。因此,仅有间接理由相信在这些字典中找到的方向对网络具有功能重要性。我们提出端到端稀疏字典学习,这是一种训练 SAEs 的方法,通过最小化原始模型输出分布与插入 SAE 激活的模型输出分布之间的 KL 散度,确保学习到的特征具有功能重要性。与标准 SAEs 相比,e2e SAEs 提供了 Pareto 改进:它们能解释更多的网络性能,需要更少的总特征数,且每个数据点需要更少的同时活跃特征,同时不损失可解释性。我们探讨了几何和定性差异。E2e 字典学习使我们更接近能够简明准确地解释网络行为的方法。我们在 https://github.com/ApolloResearch/e2e_sae 发布了用于训练 e2e SAEs 并复现我们分析的库。
引用
@article{arxiv.2405.12241,
title = {Identifying Functionally Important Features with End-to-End Sparse Dictionary Learning},
author = {Dan Braun and Jordan Taylor and Nicholas Goldowsky-Dill and Lee Sharkey},
journal= {arXiv preprint arXiv:2405.12241},
year = {2024}
}