利用领域知识教机器自我解释
机器学习
2020-12-04 v1 人工智能
摘要
机器学习(ML)日益被用于辅助人类做出更好、更快的决策。然而,参与循环的非技术型人类难以理解模型预测背后的原理,阻碍了人们对算法决策系统的信任。关于 AI 可解释性的大量研究工作试图通过开发解释方法来赢回对 AI 系统的信任,但至今仍无重大突破。与此同时,流行的解释方法(如 LIME 和 SHAP)所产生的解释对于非数据科学背景的人员来说非常难以理解。为此,我们提出 JOEL,一种基于神经网络的框架,用于联合学习决策任务及传达领域知识的相关解释。JOEL 专为缺乏深厚技术 ML 知识的领域专家(人在回路中)量身打造,提供关于模型预测的高层洞察,这些洞察非常类似于专家自身的推理过程。此外,我们从一组认证专家处收集领域反馈,并用其改进模型(人类教学),从而促成无缝且更贴切的解释。最后,我们借助遗留专家系统与领域分类法之间的语义映射,自动标注一个引导训练集,克服了基于概念的人类标注的缺失。我们在真实世界的欺诈检测数据集上实证验证了 JOEL。我们表明 JOEL 能够泛化引导数据集上的解释。此外,所得结果表明人类教学可进一步将解释预测质量提升约 。
引用
@article{arxiv.2012.01932,
title = {Teaching the Machine to Explain Itself using Domain Knowledge},
author = {Vladimir Balayan and Pedro Saleiro and Catarina Belém and Ludwig Krippahl and Pedro Bizarro},
journal= {arXiv preprint arXiv:2012.01932},
year = {2020}
}