推进移动平台上深度视觉识别的极限
计算机视觉与模式识别
2017-11-23 v2 机器学习
摘要
图像分类是将固定类别集合中的一个标签分配给输入图像的任务。其最重要的应用领域之一是机器人技术,特别是机器人需要感知周围环境,并利用这些信息来辅助其完成任务。在本工作中,我们考虑机器人进入新环境并希望理解来自其摄像头的视觉数据以从中提取知识的问题。作为主要创新点,我们希望克服对物理机器人的需求,因为物理机器人可能昂贵且不便,从而有望促进、加速并简化该领域的研究。这就是为什么我们提出为移动平台开发一个封装了多个深度视觉识别任务的应用程序。首先,我们处理简单的图像分类任务,测试在 ILSVRC 2012 数据集上训练的 AlexNet 所得到的模型。我们考虑了多种照片设置,以更好地理解哪些因素最影响分类质量。出于同一目的,我们希望将分类任务与一个处理图像内目标分割的额外模块相集成。具体而言,我们提出了一种提取目标形状并移除所有背景的技术,以便仅将分类集中于目标所占的区域。包含的另一个重要任务是目标发现。其目的是模拟机器人需要特定物体来完成其某项活动的情况。机器人通过环顾四周并尝试扫描周围环境来理解物体的位置,从而开始寻找所需的东西。最后,我们提供了一个用于创建自定义任务特定数据库的工具,旨在更好地满足特定视觉任务的需求。
引用
@article{arxiv.1710.05982,
title = {Pushing the envelope in deep visual recognition for mobile platforms},
author = {Lorenzo Alvino},
journal= {arXiv preprint arXiv:1710.05982},
year = {2017}
}