利用符号梯度对神经网络潜在空间进行闭式解释
机器学习
2025-09-29 v4 人工智能
摘要
已有研究表明,自编码器或 Siamese 网络等人工神经网络在其潜在空间中编码了有意义的概念。然而,目前尚不存在一个能够在没有先验知识的情况下以人类可读形式检索这些信息的综合框架。在定量学科中,概念通常被表述为方程。因此,为了提取这些概念,我们引入了一个框架,用于寻找人工神经网络潜在空间中神经元的闭式解释。该解释框架基于将训练好的神经网络嵌入到编码相同概念的函数等价类中。我们通过寻找该等价类与由符号搜索空间定义的人类可读方程之间的交集来解释这些神经网络。在计算上,该框架基于寻找一个符号表达式,使其归一化梯度与特定神经元关于输入变量的归一化梯度相匹配。通过从 Siamese 神经网络的潜在空间中检索矩阵不变量和动力学系统的守恒量,我们展示了该方法的有效性。
关键词
引用
@article{arxiv.2409.05305,
title = {Closed-Form Interpretation of Neural Network Latent Spaces with Symbolic Gradients},
author = {Sebastian J. Wetzel and Zakaria Patel},
journal= {arXiv preprint arXiv:2409.05305},
year = {2025}
}
备注
Major Revision, new code for experiments, reflect author contributions