中文

面向高维数据集的黑盒机器学习模型解释方法

机器学习 2024-07-30 v4

摘要

深度神经网络(DNNs)由于在建模复杂问题和处理高维数据集方面的有效性,已被证明在广泛的应用领域中优于传统机器学习算法。然而,许多现实生活中的数据集维度越来越高,其中大量特征对于监督和无监督学习任务可能都是无关的。引入这些特征不仅会带来不必要的噪声,还会增加计算复杂度。此外,由于大量特征之间高度非线性和依赖性,DNN 模型由于其内部运作机制尚不被充分理解,往往不可避免地不透明并被视为黑盒方法。其算法复杂性通常超出人类理解无数超参数之间相互作用的能力。一个具有良好可解释性的模型能够识别具有统计显著性的特征,并解释它们影响模型输出的方式。在本文中,我们提出了一种高效方法,用于在高维数据集的分类任务中提升黑盒模型的可解释性。首先,我们在高维数据集上训练一个黑盒模型,以学习用于执行分类的嵌入表示。为了分解黑盒模型的内部工作原理并识别前 k 个重要特征,我们采用不同的探测与扰动技术。然后,我们在前 k 个特征空间上通过可解释代理模型来近似黑盒模型的行为。最后,我们从代理模型中导出决策规则和局部解释,以解释个体决策。我们的方法在不同维度介于 50 到 20,000 的数据集上,就指标和可解释性而言,优于 TabNet 和 XGboost 等最先进(state-of-the-art)方法。

关键词

引用

@article{arxiv.2208.13405,
  title  = {Interpreting Black-box Machine Learning Models for High Dimensional Datasets},
  author = {Md. Rezaul Karim and Md. Shajalal and Alex Graß and Till Döhmen and Sisay Adugna Chala and Alexander Boden and Christian Beecks and Stefan Decker},
  journal= {arXiv preprint arXiv:2208.13405},
  year   = {2024}
}

备注

This paper is currently under review in a journal