从媒体分类任务中定位可解释的多尺度信息块
计算机视觉与模式识别
2020-04-20 v2
摘要
深度卷积神经网络(CNN)始终依赖于更宽的感受野(RF)和更复杂的非线性来实现最先进的性能,但同时也面临难以解释相关块如何贡献最终预测的困难。本文构建了一个可解释的 AnchorNet,配备我们精心设计的感受野和线性空间聚合,在仅受媒体级标签监督且无需任何额外边界框标注的情况下,提供输入媒体的逐块可解释性,并定位多尺度信息块。对定位出的信息和文本块的视觉化显示了 AnchorNet 优越的多尺度定位能力。我们进一步将定位出的块用于广泛应用的网络中的下游分类任务。实验结果表明,用其块替换原始输入进行分类可获得明显的推理加速且仅有微小性能下降,这证明定位出的块确实保留了原始输入的大部分语义和证据。
引用
@article{arxiv.2002.03737,
title = {Localizing Interpretable Multi-scale informative Patches Derived from Media Classification Task},
author = {Chuanguang Yang and Zhulin An and Xiaolong Hu and Hui Zhu and Yongjun Xu},
journal= {arXiv preprint arXiv:2002.03737},
year = {2020}
}