中文

将可解释性视为压缩:以 MDL-SAEs 重新审视稀疏自编码器对神经激活的解释

机器学习 2024-10-16 v1 人工智能 信息论 math.IT

摘要

稀疏自编码器(SAEs)已成为解释神经网络内部表征的有用工具。然而,仅优化 reconstruction loss 和稀疏性会导致 SAEs 极宽且稀疏。我们提出了一种信息论框架,将 SAEs 解释为用于传达神经激活解释的有损压缩算法。我们援引最小描述长度(MDL)原则,以激励准确且简洁的激活解释。我们进一步认为,可解释的 SAEs 需要一种额外属性:“独立可加性”:特征应能够单独被理解。我们演示了一个示例,通过在 MNIST 手写数字数据集上训练 SAEs,发现代表显著线段的 SAE 特征最优,而不是来自数据集中记忆数字或小数字碎片的特征。我们认为,使用 MDL 而非稀疏性可避免如最大化稀疏性可能导致的特征分割等潜在问题,同时该框架自然地建议新的分层 SAEs 架构,提供更简洁的解释。

关键词

引用

@article{arxiv.2410.11179,
  title  = {Interpretability as Compression: Reconsidering SAE Explanations of Neural Activations with MDL-SAEs},
  author = {Kola Ayonrinde and Michael T. Pearce and Lee Sharkey},
  journal= {arXiv preprint arXiv:2410.11179},
  year   = {2024}
}

备注

8 pages, 5 figures