中文

多标签图像分类中基于图像级监督的空间正则化学习

计算机视觉与模式识别 2017-04-03 v2

摘要

多标签图像分类是计算机视觉中基础但具挑战性的任务。近年来,通过利用标签间的语义关系已取得巨大进展。然而,传统方法无法对多标签图像中标签间的底层空间关系建模,因为通常未提供标签的空间标注。本文中,我们提出一个统一的深度神经网络,仅利用图像级监督来挖掘标签间的语义与空间关系。给定多标签图像,我们提出的空间正则化网络(SRN)为所有标签生成注意力图,并通过可学习卷积捕获它们之间的底层关系。通过将正则化分类结果与 ResNet-101 网络的原始结果聚合,分类性能可得到持续提升。整个深度神经网络仅使用图像级标注进行端到端训练,因此无需额外的图像标注工作。在 3 个具有不同类型标签的公开数据集上的大量评估表明,我们的方法显著优于当前最优方法并具有强大的泛化能力。对学到的 SRN 模型的分析表明,它能有效捕获标签的语义与空间关系以提升分类性能。

关键词

引用

@article{arxiv.1702.05891,
  title  = {Learning Spatial Regularization with Image-level Supervisions for Multi-label Image Classification},
  author = {Feng Zhu and Hongsheng Li and Wanli Ouyang and Nenghai Yu and Xiaogang Wang},
  journal= {arXiv preprint arXiv:1702.05891},
  year   = {2017}
}