中文

通过自解释学习

人工智能 2024-09-18 v3 机器学习

摘要

多数可解释AI研究将解释视为模型检视的手段。然而,这忽略了人类心理学中描述智能体学习过程中自解释益处的发现。受此启发,我们在图像分类背景下引入一种称为“通过自解释学习”(Learning by Self-Explaining, LSX)的新工作流。LSX利用了自精炼AI与人工引导解释性机器学习的若干方面。其底层思想是:学习器模型除优化原始预测任务外,还基于来自内部评判模型的解释反馈进一步优化。直观上,若内部评判模型能依据这些解释执行相同任务,则学习器的解释被视为“有用”。我们概述了LSX的重要组件,并基于此通过三种不同的示例实例化进行了广泛的实验评估。我们的结果表明,通过自解释学习在多个层面带来提升:模型泛化能力、减少混淆因素的影响,以及提供更任务相关且忠实于模型的解释。总体而言,我们的工作为AI模型学习阶段中自解释的潜力提供了证据。

关键词

引用

@article{arxiv.2309.08395,
  title  = {Learning by Self-Explaining},
  author = {Wolfgang Stammer and Felix Friedrich and David Steinmann and Manuel Brack and Hikaru Shindo and Kristian Kersting},
  journal= {arXiv preprint arXiv:2309.08395},
  year   = {2024}
}