基于ReLU神经网络几何性质的因果解释
机器学习
2026-05-12 v1 神经与进化计算
摘要
神经网络已被证明是自主系统控制策略学习的有效手段,但由于神经网络的黑箱本质,这些学习到的策略难以理解。这种缺乏可解释性使得针对此类自主系统的安全保证提出了巨大挑战。可解释人工智能(XAI)和可解释强化学习(XRL)领域旨在解释神经网络和自主代理的决策过程。在 particular,针对模型作出给定决策的"为什么"和"为什么不"解释的工作旨在提供解释。然而,迄今为止大多数可解释性工作都利用提炼版原始模型。虽然这种提炼策略是可解释的,但与原始模型相比性能会显著下降,且不能保证是原始模型决策过程的准确反映,因而无法用于保证其安全性。最近的工作表明,ReLU神经网络的几何性质可被理解:一个ReLU网络对应于划分为由n维凸多面体定义的分段线性函数。通过这一视角,神经网络可被理解为将输入空间划分为多个 distinct 区域,每个区域为每个输出神经元应用单个线性函数。我们展示,这种几何表示可用于生成类似于前述工作的因果解释,但从ReLU神经网络的几何中直接提取规则,因此能准确反映网络行为。
引用
@article{arxiv.2605.10396,
title = {Causal Explanations from the Geometric Properties of ReLU Neural Networks},
author = {Hector Woods and Philippa Ryan and Rob Alexander},
journal= {arXiv preprint arXiv:2605.10396},
year = {2026}
}
备注
7 pages, 0 figures, Accepted for presentation at the Yorkshire Innovation in Science and Engineering Conference