硕士论文:用于视觉识别的深度学习
计算机视觉与模式识别
2016-10-19 v1
摘要
我们研究的目标是开发推进自动视觉识别的方法。为了预测与图像关联的单一或多个标签,我们研究不同种类的深度神经网络架构和用于监督特征学习的方法。我们首先对卷积神经网络进行最先进综述,旨在理解这类统计模型背后的历史、现代架构的局限以及当前用于训练深度CNN的新技术。我们工作的创新性在于关注低数据量任务的途径。我们引入不同的模型和技术,以在若干种类的数据集上实现最佳精度,例如用于构建Web API的食谱中等规模数据集(100k图像),或用于我们赢得的DSG在线挑战赛的卫星图像小规模数据集(6,000)。我们还对弱监督学习进行了最先进综述,引入能够定位感兴趣区域的不同种类CNN。我们最后的贡献是一个构建在Torch7之上的框架,用于在任意视觉识别任务和任意规模数据集上训练和测试深度模型。
引用
@article{arxiv.1610.05567,
title = {Master's Thesis : Deep Learning for Visual Recognition},
author = {Rémi Cadène and Nicolas Thome and Matthieu Cord},
journal= {arXiv preprint arXiv:1610.05567},
year = {2016}
}