"忠实于什么?"——基于保真度解释方法的局限性
机器学习
2026-04-21 v5 机器学习
摘要
在可解释人工智能中,代理模型通常通过其对神经网络预测的保真度来评估。然而,保真度衡量的是与所学模型的对齐程度,而非与任务底层数据生成信号的对齐。本工作引入了线性度评分λ(f),一种诊断工具,用于量化回归网络输入-输出行为在多大程度上是线性可解码的。λ(f)定义为代理模型对网络拟合的R²度量。在合成和真实世界回归数据集上,我们发现代理模型可以在对神经网络保持高保真度的同时,未能恢复区分网络与更简单模型的预测增益。在若干情况下,高保真度代理模型的表现甚至不如直接在数据上训练的线性基线。这些结果表明,解释模型行为并不等同于解释数据的任务相关结构,凸显了基于保真度的解释方法在推理预测性能时的局限性。
引用
@article{arxiv.2506.12176,
title = {"Faithful to What?" On the Limits of Fidelity-Based Explanations},
author = {Jackson Eshbaugh},
journal= {arXiv preprint arXiv:2506.12176},
year = {2026}
}
备注
6 pages, 3 figures, 3 tables. Accepted at the Workshop on Scientific Methods for Understanding Deep Learning (Sci4DL) at ICLR 2026. Code available at https://github.com/jacksoneshbaugh/lambda-linearity-score/tree/main