CNN:从单标签到多标签
计算机视觉与模式识别
2016-12-06 v3
摘要
卷积神经网络(CNN)在单标签图像分类任务中已展现出令人瞩目的性能。然而,CNN 如何最佳地处理多标签图像仍然是一个未决问题,这主要是由于潜在的物体布局复杂以及多标签训练图像不足。在本工作中,我们提出了一种灵活的深度 CNN 架构,称为假设-CNN-池化(Hypotheses-CNN-Pooling, HCP)。该架构以任意数量的物体分割假设为输入,每个假设连接一个共享的 CNN,最后通过最大池化聚合不同假设的 CNN 输出结果,以生成最终的多标签预测。这种灵活的深度 CNN 架构具有一些独特的特性:1) 训练无需真实边界框信息;2) 整个 HCP 架构对可能存在的噪声和/或冗余假设具有鲁棒性;3) 无需明确的假设标签;4) 共享 CNN 可以利用大规模单标签图像数据集(如 ImageNet)进行良好的预训练;5) 它能够自然地输出多标签预测结果。在 Pascal VOC2007 和 VOC2012 多标签图像数据集上的实验结果充分证明了所提出的 HCP 架构优于其他最先进方法。特别是在 VOC2012 数据集上,仅使用 HCP 的 mAP 即达到 84.2%,而在与我们在 [47] 中基于手工特征的互补结果融合后达到 90.3%,以超过 7% 的显著优势大幅超越了最先进方法。
引用
@article{arxiv.1406.5726,
title = {CNN: Single-label to Multi-label},
author = {Yunchao Wei and Wei Xia and Junshi Huang and Bingbing Ni and Jian Dong and Yao Zhao and Shuicheng Yan},
journal= {arXiv preprint arXiv:1406.5726},
year = {2016}
}
备注
13 pages, 10 figures, 3 tables