中文

利用边界框标注进行多标签目标识别

计算机视觉与模式识别 2016-06-06 v2 机器学习

摘要

卷积神经网络(CNNs)作为目标识别应用的通用特征表示已展现出优异性能。然而,对于包含不同类别、尺度和位置的多个物体的多标签图像,全局 CNN 特征并非最优。本文中,我们引入局部信息以增强特征的判别能力。具体而言,我们首先从每幅图像中提取目标候选区域。将每幅图像视为一个包,从中提取的目标候选区域视为实例,我们将多标签识别问题转化为多类多示例学习问题。然后,除了从每个候选区域提取典型的 CNN 特征表示外,我们提议利用真值边界框标注(强标签)通过使用局部区域的最近邻关系形成多视图流程,以增添另一层次的局部信息。所提出的多视图多示例框架有效利用了弱标签和强标签,更重要的是,它具备泛化能力,甚至能通过来自其他类别的部分强标签提升未见过类别的性能。我们的框架在两个多标签基准数据集上与最先进的基于手工特征的方法和基于 CNN 的方法进行了广泛比较。实验结果验证了所提框架的判别能力与泛化能力。借助强标签,我们的框架在两个数据集上均能取得最先进结果。

关键词

引用

@article{arxiv.1504.05843,
  title  = {Exploit Bounding Box Annotations for Multi-label Object Recognition},
  author = {Hao Yang and Joey Tianyi Zhou and Yu Zhang and Bin-Bin Gao and Jianxin Wu and Jianfei Cai},
  journal= {arXiv preprint arXiv:1504.05843},
  year   = {2016}
}

备注

Accepted in CVPR 2016