可逆网络的决策解释与特征重要性
机器学习
2019-10-16 v2 机器学习
摘要
深度神经网络由于其黑盒特性,易受对抗攻击且难以解释。近期提出的可逆网络能够从其各层输出精确重建该层输入,因此具有揭示黑盒模型的潜力。可逆网络分类器可视为一个两阶段模型:(1) 从输入空间到特征空间的可逆变换;(2) 特征空间中的线性分类器。我们可在特征空间中确定线性分类器的决策边界;由于变换可逆,我们可将决策边界从特征空间反演至输入空间。此外,我们提出确定数据点至决策边界的投影,并将解释定义为数据与其投影之差。最后,我们提出用一阶泰勒展开局部近似神经网络,并利用局部线性模型定义特征重要性。我们提供了方法的实现:\url{https://github.com/juntang-zhuang/explain_invertible}。
引用
@article{arxiv.1910.00406,
title = {Decision Explanation and Feature Importance for Invertible Networks},
author = {Juntang Zhuang and Nicha C. Dvornek and Xiaoxiao Li and Junlin Yang and James S. Duncan},
journal= {arXiv preprint arXiv:1910.00406},
year = {2019}
}
备注
Correct notations