中文

可解释性的定义与可解释模型的学习

机器学习 2021-06-01 v1 人机交互

摘要

随着机器学习算法被应用于越来越多的场景中,可解释性已成为一项关键需求。本文中,我们提出了人类可解释模型的数学定义。具体而言,我们在两个信息处理系统之间定义可解释性。若一个预测模型基于上述可解释性定义可由人类识别系统解释,则该预测模型被定义为完全人类可解释模型。我们进一步设计了一个通过用户交互训练完全人类可解释模型的实用框架。在图像数据集上的实验展示了我们所提模型两方面的优势:1) 完全人类可解释模型能提供人类可理解的完整决策过程;2) 完全人类可解释模型对对抗攻击更具鲁棒性。

关键词

引用

@article{arxiv.2105.14171,
  title  = {The Definitions of Interpretability and Learning of Interpretable Models},
  author = {Weishen Pan and Changshui Zhang},
  journal= {arXiv preprint arXiv:2105.14171},
  year   = {2021}
}

备注

18 pages, 5 figures