基于CNN的场景识别:物体、尺度与数据集偏差
计算机视觉与模式识别
2018-01-23 v1
摘要
由于场景部分由物体构成,准确的场景识别需要关于场景和物体的知识。本文探讨两个相关问题:1)多尺度卷积神经网络(CNN)架构中由尺度引发的数据集偏差,以及2)如何在CNN中有效结合以场景为中心和以物体为中心的知识(即Places和ImageNet)。早前尝试的Hybrid-CNN表明引入ImageNet帮助不大。本文提出一种考虑尺度的替代方法,显著提升了识别性能。通过分析ImageNet-CNNs和Places-CNNs在不同尺度下的响应,我们发现二者工作于不同的尺度范围,因此对所有尺度使用同一网络会引发数据集偏差,导致性能受限。因而,将特征提取器适配于各个特定尺度(即尺度专用CNNs)对于改善识别至关重要,因为场景中的物体具有其特定的尺度范围。实验结果表明,识别准确率高度依赖于尺度,且简单而精心选择的多尺度ImageNet-CNNs与Places-CNNs组合可将SUN397上的最优识别准确率提升至66.26%(使用更深架构甚至达70.17%,可与人类表现媲美)。
引用
@article{arxiv.1801.06867,
title = {Scene recognition with CNNs: objects, scales and dataset bias},
author = {Luis Herranz and Shuqiang Jiang and Xiangyang Li},
journal= {arXiv preprint arXiv:1801.06867},
year = {2018}
}
备注
CVPR 2016