大规模受控物体数据集能让我们了解CNN的哪些特性?
计算机视觉与模式识别
2016-01-27 v2
摘要
对任何物体识别系统(无论是人类还是机器)而言,对图像变化(如平移、尺度、姿态、光照)的容差都是一个重要期望属性。在计算机视觉领域,尤其是在极度流行的深度学习模型出现后,使用越来越大的数据集已成为趋势。尽管这些大规模真实数据集对于学习物体类间和类内形状变化的不变性非常有用,但它们对于学习对其他参数的不变性却用处不大,迫使研究者借助其他技巧来训练模型。在本工作中,我们引入了一个免费公开的大规模合成数据集,并利用它来回答关于卷积神经网络不变性与选择性特性的几个基本问题。我们的数据集包含两部分:a) 在转盘上拍摄的物体:16个类别、8个旋转角度、半圆拱上11台相机、5种光照条件、3个对焦级别、多种背景(每实例23.4个),每个实例生成1320张图像(总计超过2000万张图像);b) 场景:机械臂在1:160比例场景中对物体拍照。我们研究了:1) 不同CNN层的不变性与选择性,2) 从一物体类别到另一类别的知识迁移,3) 构建训练集的图像系统或随机采样,4) 从合成场景到自然场景的域适应,5) 向CNN输送知识的顺序。我们还探讨了我们的分析如何引导该领域开发更高效的CNN。
引用
@article{arxiv.1512.01320,
title = {What can we learn about CNNs from a large scale controlled object dataset?},
author = {Ali Borji and Saeed Izadi and Laurent Itti},
journal= {arXiv preprint arXiv:1512.01320},
year = {2016}
}