通过自解释学习
人工智能
2024-09-18 v3 机器学习
摘要
多数可解释AI研究将解释视为模型检视的手段。然而,这忽略了人类心理学中描述智能体学习过程中自解释益处的发现。受此启发,我们在图像分类背景下引入一种称为“通过自解释学习”(Learning by Self-Explaining, LSX)的新工作流。LSX利用了自精炼AI与人工引导解释性机器学习的若干方面。其底层思想是:学习器模型除优化原始预测任务外,还基于来自内部评判模型的解释反馈进一步优化。直观上,若内部评判模型能依据这些解释执行相同任务,则学习器的解释被视为“有用”。我们概述了LSX的重要组件,并基于此通过三种不同的示例实例化进行了广泛的实验评估。我们的结果表明,通过自解释学习在多个层面带来提升:模型泛化能力、减少混淆因素的影响,以及提供更任务相关且忠实于模型的解释。总体而言,我们的工作为AI模型学习阶段中自解释的潜力提供了证据。
引用
@article{arxiv.2309.08395,
title = {Learning by Self-Explaining},
author = {Wolfgang Stammer and Felix Friedrich and David Steinmann and Manuel Brack and Hikaru Shindo and Kristian Kersting},
journal= {arXiv preprint arXiv:2309.08395},
year = {2024}
}