假设类别决定解释:为何准确模型在特征归因上会发生分歧
机器学习
2026-03-18 v1 人工智能
摘要
预测等价模型产生等价解释的假设是许多可解释AI实践的基础,包括模型选择、审计和监管评估。在本文中,我们显示了这一假设不成立。通过对24个数据集和多个模型类别进行大规模实证研究,我们发现具有相同预测行为的模型可以产生显着不同的特征归因。这种不一致性是高度结构化的:同一假设类别内的模型表现出强烈一致性,而跨类别的配对(例如,树基 vs. 线性)在相同数据划分上训练后显示出显著降低的一致性,始终接近或低于抽奖阈值。我们确定假设类别是这一现象的结构驱动因素,我们称之为解释抽奖 (Explanation Lottery)。我们理论上表明,由于数据生成过程中的相互作用结构,所得的一致性差距 (Agreement Gap) 仍然存在。这一结构性发现激发了一个后验诊断,即解释可靠性得分 R(x),该得分在无需额外训练的情况下预测解释在不同架构下的稳定性。我们的结果表明,模型选择并非解释中性:为部署选择的假设类别可以决定哪些特征被归因于决定。
引用
@article{arxiv.2603.15821,
title = {Hypothesis Class Determines Explanation: Why Accurate Models Disagree on Feature Attribution},
author = {Thackshanaramana B},
journal= {arXiv preprint arXiv:2603.15821},
year = {2026}
}
备注
17 pages, 1 figure. Submitted to TMLR