ScoresActivation:一种面向模型无关全局可解释性的新型激活函数设计
机器学习
2025-11-19 v1 人工智能
摘要
理解大型深度学习模型的决策是构建透明可信系统的关键挑战。虽然当前的后置解释方法提供了有价值的特征重要性见解,但它们本质上与模型训练过程脱节,限制了其忠实性和实用性。本文介绍一种新型可微方法,通过设计实现全局可解释性,将特征重要性估计直接集成到模型训练中。我们方法的核心是 ScoresActivation 函数,这是一种嵌入学习管道中的特征排序机制。这种集成使模型能够以可微和端到端可训练的方式优先考虑其对预测性能贡献的特征。跨越基准数据集的评估表明,我们的方法产生全球忠实、稳定的特征排序,与 SHAP 值和真实特征重要性一致,同时保持高预测性能。此外,特征评分速度比经典 SHAP 方法快 150 倍,仅需训练时 2 秒,而 SHAP 在相同配置下进行特征排序需 300 秒。我们的方法还通过 10 个特征(其中 5 个为相关特征)提升分类准确率 11.24%,通过 16 个特征(其中 5 个为相关特征,11 个为无关特征)提升 29.33%,显示出对无关输入的鲁棒性。这一工作弥合了模型准确率与可解释性之间的鸿沟,为可 inherently 可解释的机器学习提供了可扩展框架。
引用
@article{arxiv.2511.13809,
title = {ScoresActivation: A New Activation Function for Model Agnostic Global Explainability by Design},
author = {Emanuel Covaci and Fabian Galis and Radu Balan and Daniela Zaharie and Darian Onchis},
journal= {arXiv preprint arXiv:2511.13809},
year = {2025}
}
备注
Paper submitted to ECAI 2025 Conference