无监督理解深度神经网络中概念的分布式表示
计算机视觉与模式识别
2024-03-07 v2 人工智能
机器学习
摘要
理解深度学习分类器所学概念的中间表示对于解释一般模型行为不可或缺。现有揭示所学概念的方法通常依赖人工监督,如预定义概念集或分割过程。本文提出了一种新颖的无监督方法,通过选择神经元的首要子集来发现概念的分布式表示。我们的实证结果表明,具有相似神经元激活状态的实例往往共享一致的概念。基于这些观察,所提方法选择首要神经元,构建一个可解释的区域,即松弛决策区域(RDR),该区域在特征空间中包含具有一致概念的实例。它可用于识别数据中未标记的子类,并检测错误分类的原因。此外,我们的方法在不同层上的适用性揭示了各层上不同的分布式表示,这为深度学习模型的内部机制提供了更深入的见解。
引用
@article{arxiv.2312.17285,
title = {Understanding Distributed Representations of Concepts in Deep Neural Networks without Supervision},
author = {Wonjoon Chang and Dahee Kwon and Jaesik Choi},
journal= {arXiv preprint arXiv:2312.17285},
year = {2024}
}
备注
Published in AAAI2024. First two authors contributed equally. The code is available at https://github.com/daheekwon/RDR