中文

视觉概念与组合投票

计算机视觉与模式识别 2017-11-15 v1

摘要

用模式理论\cite{Mumford2010pattern}来表述视觉是很有吸引力的,其中模式由基本构建块的组合按层次定义。但将模式理论应用于真实世界图像目前不如深度网络等判别方法成功。然而,深度网络是难以解释的黑盒,并且容易通过添加遮挡物体而被欺骗。很自然地会想,通过更好地理解深度网络,我们能否提取可用于开发模式理论模型的构建块。这促使我们使用来自PASCAL3D+数据集的车辆图像研究深度网络的内部表示。我们使用聚类算法研究特征的群体活动,并提取一组视觉概念,我们展示这些概念在视觉上紧凑且对应于车辆的语义部件。为此,我们用语义部件标注这些车辆以创建一个新数据集VehicleSemanticParts,并将视觉概念作为无监督部件检测器进行评估。我们展示视觉概念表现相当好,但不如支持向量机(SVM)等监督判别方法。接下来我们给出视觉概念及其与语义部件关系的更详细分析。此后,我们使用视觉概念作为简单模式理论模型(我们称之为组合投票)的构建块。在该模型中,若干视觉概念组合以检测语义部件。我们展示该方法显著优于专为语义部件检测训练的SVM和深度网络等判别方法。最后,我们通过创建带遮挡的标注数据集VehicleOcclusion回归研究遮挡,并展示当遮挡量变大时组合投票甚至优于深度网络。

关键词

引用

@article{arxiv.1711.04451,
  title  = {Visual Concepts and Compositional Voting},
  author = {Jianyu Wang and Zhishuai Zhang and Cihang Xie and Yuyin Zhou and Vittal Premachandran and Jun Zhu and Lingxi Xie and Alan Yuille},
  journal= {arXiv preprint arXiv:1711.04451},
  year   = {2017}
}

备注

It is accepted by Annals of Mathematical Sciences and Applications