当显著性偏离切线:用非线性显著性图解释深度神经网络
机器学习
2023-01-18 v3 机器学习
摘要
在关键应用中运用复杂机器学习系统的一个根本瓶颈在于不知其为何为之、何所为,从而阻碍了任何关键安全协议的制定。迄今为止,尚无方法能就神经网络决策过程的粒度提供完整洞见。过去,显著性图曾是通过敏感度计算解决此问题的早期尝试,即依据系统输出对数据点的各维度之敏感程度来选取维度。然而,显著性图的成功至多有限,主要因其通过线性近似来解释底层学习系统。我们提出一类生成非线性显著性图的新方法,其充分考量底层学习系统的非线性。在线性显著性图正确的简单问题上,它们与线性显著性图一致;而在非线性更显著的复杂示例中,它们能清晰识别更具针对性的分类驱动因素。这类新方法显著助力深度神经网络及相关机器学习系统的可解释性。关键在于,它们为其在严肃应用中的更广泛应用提供了起点,其中“为何”与“何为”同等重要。
引用
@article{arxiv.2110.06639,
title = {When saliency goes off on a tangent: Interpreting Deep Neural Networks with nonlinear saliency maps},
author = {Jan Rosenzweig and Zoran Cvetkovic and Ivana Rosenzweig},
journal= {arXiv preprint arXiv:2110.06639},
year = {2023}
}