中文

基于区域潜在语义依赖的多标签图像分类

计算机视觉与模式识别 2017-03-14 v3

摘要

深度卷积神经网络(CNN)在单标签图像分类上展现了先进的性能,在将 CNN 方法应用于多标签图像分类方面也取得了各种进展,多标签图像分类要求一次性标注物体、属性、场景类别等。最近多标签图像分类的 state-of-the-art 方法利用图像中的标签依赖关系(在全局层面),大幅提升了标注能力。然而,由于全局视觉特征的判别力有限,预测小物体和视觉概念仍然具有挑战性。在本文中,我们提出了一种区域潜在语义依赖模型(RLSD)来解决这一问题。所使用的模型包含一个全卷积定位架构,用于定位可能包含多个高度依赖标签的区域。定位后的区域被进一步送入循环神经网络(RNN),以刻画区域层面的潜在语义依赖。在几个基准数据集上的实验结果表明,与 state-of-the-art 模型相比,我们提出的模型取得了最佳性能,尤其是在预测图像中出现的小物体方面。此外,我们在训练期间使用边界框坐标建立了一个上界模型(RLSD+ft-RPN),实验结果还表明,我们的 RLSD 在不使用边界框标注的情况下即可逼近该上界,这在现实世界中更为实用。

关键词

引用

@article{arxiv.1612.01082,
  title  = {Multi-Label Image Classification with Regional Latent Semantic Dependencies},
  author = {Junjie Zhang and Qi Wu and Chunhua Shen and Jian Zhang and Jianfeng Lu},
  journal= {arXiv preprint arXiv:1612.01082},
  year   = {2017}
}