EvoXplain:当机器学习模型在预测上一致却在解释上不一致——衡量跨训练运行的机制性重复性
机器学习
2026-02-12 v4 人工智能
摘要
机器学习模型主要以预测性能为标准,尤其是在应用场景中。一旦模型达到高准确率,其解释往往被假设为正确且可信。这种假设引出了一个被忽视的问题:当两个模型都达到高准确率时,它们是否依赖相同的内部逻辑,或者它们是否通过不同的且 potentially 竞争的机制到达相同的结果?我们介绍EvoXplain,一个诊断框架,用于衡量跨重复训练的模型解释稳定性。而不是分析单个训练好的模型的解释,EvoXplain将解释视为从训练和模型选择管道本身抽取的样本,无需聚合预测或构建集团。它检查这些样本是否形成单一的连贯解释制深或分离到多个结构化解释制深中。我们在Adult Income和Breast Cancer数据集上使用深度神经网络和Logistic回归进行评估。尽管所有模型都实现了高的预测准确率,但解释稳定性在不同管道之间存在差异。在Breast Cancer数据集上,深度神经网络收敛到单一的解释制深,而在Adult Income数据集上则分离为多个解释制深,尽管训练条件完全相同。Logistic回归在Breast Cancer数据集上表现出条件性重复性,其中制深的可达性由正则化配置控制。EvoXplain并不试图选择正确的解释。相反,它使解释结构可见且可量化,揭示了单实例解释如何掩盖多个可接受预测机制的存在。更广泛地说,EvoXplain重新定义了可解释性作为在重复实例化下训练管道的属性,而不是任何单个训练模型的属性。
引用
@article{arxiv.2512.22240,
title = {EvoXplain: When Machine Learning Models Agree on Predictions but Disagree on Why -- Measuring Mechanistic Multiplicity Across Training Runs},
author = {Chama Bensmail},
journal= {arXiv preprint arXiv:2512.22240},
year = {2026}
}