中文

在无训练数据访问权限下解释神经网络

机器学习 2024-01-15 v1 人工智能

摘要

我们考虑在网络训练数据不可访问的情况下生成神经网络的解释,例如由于隐私或安全问题。近来,I\mathcal{I}-Net 被提出作为一种无需样本、事后全局模型可解释性的方法,其不需要访问训练数据。它们将解释形式化为一个机器学习任务,将网络表示(参数)映射到可解释函数的表示。本文中,我们将 I\mathcal{I}-Net 框架扩展到以标准与软决策树作为代理模型的情形。我们提出了一种合适的决策树表示及相应 I\mathcal{I}-Net 输出层的设计。此外,我们通过在其训练数据生成时考虑更真实的分布,使 I\mathcal{I}-Net 适用于真实世界任务。我们针对传统全局、事后可解释性方法对我们的方法进行了实证评估,并表明在训练数据不可访问时其取得了更优的结果。

关键词

引用

@article{arxiv.2206.04891,
  title  = {Explaining Neural Networks without Access to Training Data},
  author = {Sascha Marton and Stefan Lüdtke and Christian Bartelt and Andrej Tschalzev and Heiner Stuckenschmidt},
  journal= {arXiv preprint arXiv:2206.04891},
  year   = {2024}
}