中文

通过广义蒸馏理解监督分类中的可解释性

机器学习 2024-09-05 v1

摘要

解释机器学习(ML)模型所采取决策的能力,对于在不同实际应用中建立信任与可靠性至关重要。近期的解释策略侧重于人类对复杂 ML 模型底层决策机制的理解。然而,这些策略受到人类主观偏见的限制。为摆脱此类人类偏见,我们提出了一种相对于其他 ML 模型定义的“通过蒸馏进行解释”的表述。我们利用信息论视角推广了用于量化可解释性的蒸馏技术,从可解释性的定义中去除真实标签的作用。我们的工作定义了监督分类模型的熵,给出了分段线性神经网络(PWLN)熵的界,以及 PWLN 可解释性的首个理论界。我们在 MNIST、Fashion-MNIST 和 Stanford40 数据集上评估了所提出的框架,并展示了该理论框架在不同监督分类场景中的适用性。

关键词

引用

@article{arxiv.2012.03089,
  title  = {Understanding Interpretability by generalized distillation in Supervised Classification},
  author = {Adit Agarwal and K. K. Shukla and Arjan Kuijper and Anirban Mukhopadhyay},
  journal= {arXiv preprint arXiv:2012.03089},
  year   = {2024}
}

备注

9 pages Paper + 3 pages Supplementary Material