中文

模型无关全局解释的信息论演化方法

机器学习 2021-05-17 v1

摘要

通过人类可解释的规则解释黑盒机器学习模型的行为是一个重要的研究领域。近期工作聚焦于在视觉、自然语言、强化学习与数据科学领域对模型行为进行局部(即针对特定预测)以及全局的解释。我们提出一种新颖的模型无关方法,其导出规则以全局解释在数值和/或类别数据上训练的分类模型行为。我们的方法构建于现有局部模型解释方法之上,提取对解释特定实例模型行为重要的条件,随后使用演化算法优化基于信息论的适应度函数,以构建解释全局模型行为的规则。我们展示了该方法在多种数据集上优于现有方法。此外,我们引入一个参数以在分布偏移场景下评估解释质量。该参数评估解释对先前未见数据分布预测模型行为的优良程度。我们展示了现有全局模型解释方法缺乏分布鲁棒性。最后,我们展示通过在用于学习解释的数据集中加入分布外样本,可提升分布偏移场景下的解释质量从而增强鲁棒性。本文所用所有数据集均公开可用。我们的方法已部署于某领先数字营销产品套件中。

关键词

引用

@article{arxiv.2105.06956,
  title  = {Information-theoretic Evolution of Model Agnostic Global Explanations},
  author = {Sukriti Verma and Nikaash Puri and Piyush Gupta and Balaji Krishnamurthy},
  journal= {arXiv preprint arXiv:2105.06956},
  year   = {2021}
}