基于迭代内省的视觉概念识别与定位
计算机视觉与模式识别
2016-05-26 v2 机器学习
摘要
卷积神经网络已被证明能够发展出与语义上有意义的物体及部件紧密对应的内部表示,尽管仅使用类别标签进行训练。类激活映射(CAM)是一种近期的方法,可轻松突出显示对网络分类决策有贡献的图像区域。我们基于这两项进展,使网络能够重新检查信息丰富的图像区域,我们称之为内省(introspection)。我们提出了一种弱监督迭代方案,通过交替进行分类与内省阶段,随着过程推进将其注意力中心转移到更具判别性的区域。我们评估了该方法,并在多个数据集上展示了其有效性,取得了具有竞争力或最先进的结果:在 Stanford-40 Actions 上,我们创下了 81.74% 的新最先进水平。在 FGVC-Aircraft 和 Stanford Dogs 数据集上,我们展示了相对于基线的持续改进,其中一些基线包含了显著更多的监督。
引用
@article{arxiv.1603.04186,
title = {Visual Concept Recognition and Localization via Iterative Introspection},
author = {Amir Rosenfeld and Shimon Ullman},
journal= {arXiv preprint arXiv:1603.04186},
year = {2016}
}