寻找并移除Clever Hans:利用解释方法调试与改进深度模型
计算机视觉与模式识别
2020-12-22 v2 机器学习
神经与进化计算
图像与视频处理
摘要
当代计算机视觉学习模型通常在具有数百万样本的超大规模(基准)数据集上训练。然而,这些数据集可能包含未被察觉且可被模型利用的偏差、伪影或错误。最坏情况下,训练所得模型并未学到用于解决其所训练问题的有效且可泛化策略,而成为“Clever-Hans”(CH)预测器,其决策基于训练数据中的虚假关联,可能产生不具代表性或不公平的,甚至可能是危险的预测器。本文中,我们基于针对大型语料库解释归因的可扩展统计分析,提供了一套综合分析框架以作出贡献。基于近期技术——谱相关性分析(Spectral Relevance Analysis),我们提出以下技术贡献与相应发现:(a) 对表现出CH行为的机器学习模型所涉伪影类与投毒类的可扩展量化;(b) 若干称为类伪影补偿(Class Artifact Compensation, ClArC)的方法,能够有效且显著减少模型的CH行为。即,我们能够对被训练于(投毒)数据集(如流行的ImageNet数据语料)上的模型进行去Hans处理。我们证明,定义于简单理论框架中的ClArC可作为神经网络训练或微调过程的一部分实现,或以事后方式通过向网络架构中注入额外层来阻止任何不良CH特征的进一步传播。利用所提方法,我们对多个数据集中的偏差与伪影提供了定性与定量分析。我们展示了这些洞察可催生改进后、更具代表性且更公平的、运行于隐式清洗数据语料上的模型。
引用
@article{arxiv.1912.11425,
title = {Finding and Removing Clever Hans: Using Explanation Methods to Debug and Improve Deep Models},
author = {Christopher J. Anders and Leander Weber and David Neumann and Wojciech Samek and Klaus-Robert Müller and Sebastian Lapuschkin},
journal= {arXiv preprint arXiv:1912.11425},
year = {2020}
}
备注
47 pages, 21 figures