神经激活模式(NAPs):所学概念的可视化可解释性
机器学习
2022-06-23 v1 人工智能
摘要
解读神经网络内部机制的关键在于理解模型学到了什么。发现有价值特征的有前景的方法基于分析激活值,当前技术侧重于分析高激活值以在神经元层面揭示有趣特征。然而,分析高激活值限制了层级别的概念发现。我们提出了一种转而考虑整个激活分布的方法。通过在神经网络层的高维激活空间中提取相似的激活轮廓,我们发现被相似处理的输入组。这些输入组代表神经激活模式(NAPs),可用于可视化和解释所学的层概念。我们发布了一个框架,可从中从预训练模型提取 NAPs,并提供一个可用于分析 NAPs 的可视化自省工具。我们用多种网络测试了我们的方法,并展示了它如何补充现有的神经网络激活值分析方法。
引用
@article{arxiv.2206.10611,
title = {Neural Activation Patterns (NAPs): Visual Explainability of Learned Concepts},
author = {Alex Bäuerle and Daniel Jönsson and Timo Ropinski},
journal= {arXiv preprint arXiv:2206.10611},
year = {2022}
}