深度学习模型中可解释概念的人机协同提取
人机交互
2021-08-10 v1
摘要
随着越来越多的人应用深度神经网络(DNNs)来解决各类问题并做出关键决策,DNNs 的解释已成为一个关键课题。基于概念的解释近来成为 DNNs 事后解释的一种流行方法。然而,识别影响模型决策的人类可理解的视觉概念是一项具有挑战性的任务,难以通过自动方法解决。我们提出了一种新颖的人机协同(human-in-the-loop)方法,用于生成用户定义概念以进行模型解释与诊断。我们方案的核心是使用主动学习,将人类知识与反馈相结合,以极少的人工标注代价训练概念提取器。我们将此过程集成到一个名为 ConceptExtract 的交互式系统中。通过两个案例研究,我们展示了该方法如何帮助分析模型行为并为不同机器学习任务和数据集提取人类友好的概念,以及如何利用这些概念理解预测、比较模型性能并提出模型改进建议。定量实验表明,我们的主动学习方法能准确提取有意义的视觉概念。更重要的是,通过识别负面 affect 模型性能的视觉概念,我们开发了相应的数据增强策略,持续提升了模型性能。
引用
@article{arxiv.2108.03738,
title = {Human-in-the-loop Extraction of Interpretable Concepts in Deep Learning Models},
author = {Zhenge Zhao and Panpan Xu and Carlos Scheidegger and Liu Ren},
journal= {arXiv preprint arXiv:2108.03738},
year = {2021}
}
备注
11 pages, 10 figures