中文

对得起正确理由:通过约束解释训练可微模型

机器学习 2017-11-15 v2 人工智能 机器学习

摘要

神经网络是当今使用的最准确的监督学习方法之一,但其不透明性使得在关键应用中难以信任它们,尤其是当训练条件与测试条件不同时。近期关于黑箱模型解释的工作已产生了一些工具(例如 LIME),用于展示预测背后的隐含规则,这有助于我们识别模型何时因错误的理由而正确。然而,这些方法无法扩展到解释整个数据集,也不能纠正它们所揭示的问题。我们引入了一种方法,通过检查并选择性惩罚可微模型的输入梯度(其提供了决策边界的法线),来高效地解释和正则化这些模型。我们基于专家标注以及一种无监督方式施加这些惩罚,该无监督方式鼓励针对同一分类问题产生具有定性不同决策边界的多样化模型。在多个数据集上,我们展示了我们的方法能生成忠实的解释,并产生在训练与测试条件不同时泛化能力显著更强的模型。

关键词

引用

@article{arxiv.1703.03717,
  title  = {Right for the Right Reasons: Training Differentiable Models by Constraining their Explanations},
  author = {Andrew Slavin Ross and Michael C. Hughes and Finale Doshi-Velez},
  journal= {arXiv preprint arXiv:1703.03717},
  year   = {2017}
}