通过展开潜在结构实现可解释的 R-CNN
计算机视觉与模式识别
2018-09-07 v2
摘要
本文首先基于展开潜在结构的思路,提出了一种在视觉理解任务中形式化模型可解释性的方法。随后以使用流行的两阶段基于区域的卷积网络(即 R-CNN)检测系统的目标检测为例进行研究。我们关注弱监督抽取式理由生成,即在检测中自动且同时学习展开目标实例的潜在判别性部件配置,而不使用任何部件配置的监督。我们利用嵌入在有向无环与或图(AOG)中的自顶向下层次化组合文法模型来探索和展开感兴趣区域(RoIs)的潜在部件配置空间。我们提出一种 AOGParsing 算子来替代 R-CNN 中广泛使用的 RoIPooling 算子。在检测中,边界框由从该 AOG 即时导出的最佳解析树解释,该解析树被视为为解释检测而生成的定性抽取式理由。我们提出一种折叠-展开方法来端到端地训练 AOG 和卷积网络。在实验中,我们基于 R-FCN 并在 PASCAL VOC 2007 和 2012 数据集上测试我们的方法。我们表明该方法能够展开有前景的潜在结构而不损害性能。
引用
@article{arxiv.1711.05226,
title = {Towards Interpretable R-CNN by Unfolding Latent Structures},
author = {Tianfu Wu and Wei Sun and Xilai Li and Xi Song and Bo Li},
journal= {arXiv preprint arXiv:1711.05226},
year = {2018}
}
备注
9 pages