通过群体编码从卷积神经网络内部状态无监督学习对象语义部件
机器学习
2016-11-15 v3 计算机视觉与模式识别
摘要
我们解决了关键问题:如何从为高级任务(如对象分类)训练的卷积神经网络(CNNs)内部状态中找到对象部件表示。本工作提供了一种新的无监督方法来学习语义部件,并给出了对CNNs内部表示的新理解。我们的技术基于这样的假设:语义部件由神经元群体而非单个滤波器表示。我们提出一种聚类技术来提取部件表示,称之为视觉概念(Visual Concepts)。我们展示了视觉概念在语义上是连贯的,即它们表示语义部件,并且在视觉上是连贯的,即相应的图像块看起来非常相似。此外,视觉概念提供了对象部件的全部空间覆盖,而不是像关键点标注中通常发现的少数稀疏部件。而且,我们将单个视觉概念视为部件检测器,并使用PASCAL3D+数据集评估其用于关键点检测,使用我们新标注的ImageNetPart数据集评估其用于部件检测。实验表明视觉概念可用于检测部件。我们还展示了一些视觉概念对多个语义部件有响应,前提是这些部件在视觉上相似。因此视觉概念具有本质属性:语义意义和检测能力。注意我们的ImageNetPart数据集提供了丰富的部件标注,覆盖整个对象,使其对其他部件相关应用有用。
引用
@article{arxiv.1511.06855,
title = {Unsupervised learning of object semantic parts from internal states of CNNs by population encoding},
author = {Jianyu Wang and Zhishuai Zhang and Cihang Xie and Vittal Premachandran and Alan Yuille},
journal= {arXiv preprint arXiv:1511.06855},
year = {2016}
}