透过可导透镜:基于相位外推的神经网络可解释性放大
机器学习
2025-06-12 v3
摘要
理解深度神经网络的内部表示与决策机制仍是一个关键的开放挑战。现有可解释性方法通常能识别出具有影响力的输入区域,但可能无法阐明模型如何区分类别,或何种具体改变能将输入从某一类别转变为另一类别。为解决这些局限性,我们提出了一个新框架,通过将网络梯度视为一种无穷小运动,以可视化类别之间的隐含路径。受基于相位的运动放大启发,我们首先使用可逆变换(特别是复数可导金字塔)分解图像,然后在变换空间中计算类条件梯度。我们并非迭代积分梯度以追踪完整路径,而是将单步梯度放大至输入并执行线性外推,以揭示模型如何从源类别移动至目标类别。通过在可导金字塔域中操作,这些放大后的梯度产生了语义有意义且空间连贯的形变,突显了分类器最敏感的方向,从而洞察其决策边界的几何结构。在合成与真实数据集上的实验表明,我们聚焦相位的外推产生了感知对齐且语义有意义的变换,为神经分类器的内部表示提供了一种新颖的可解释视角。
引用
@article{arxiv.2506.02300,
title = {Through a Steerable Lens: Magnifying Neural Network Interpretability via Phase-Based Extrapolation},
author = {Farzaneh Mahdisoltani and Saeed Mahdisoltani and Roger B. Grosse and David J. Fleet},
journal= {arXiv preprint arXiv:2506.02300},
year = {2025}
}