从噪声网络数据学习深度视觉物体模型:如何使其行之有效
计算机视觉与模式识别
2018-05-23 v1 数据库
机器学习
机器人学
摘要
深度网络在大规模数据集合上训练时表现优异。这使得 ImageNet 在用于视觉物体分类的深度架构发展中占据了核心地位。然而,ImageNet 是在特定时期创建的,因此容易出现过时以及数据集偏差问题。超越固定的训练数据集将带来更鲁棒的视觉系统,尤其是当部署在必须针对其所遇物体进行训练的新环境中的机器人上时。为了实现这一点,摆脱对人工标注者的依赖至关重要。最近的工作已开始研究如何利用网络上可用的大量图像来代替人工图像标注。我们通过两个发现为这一研究方向做出贡献:(1) 一项研究,针对两种深度架构、两种不同类型的噪声,将给定水平的噪声标签与预期的准确率下降相关联,该研究明确指出 GoogLeNet 是适合从网络数据学习的架构;(2) 一种基于视觉和自然语言处理概念扩展策略的秘诀,用于创建具有最小噪声和最大视觉可变性的网络数据集。通过结合这两个结果,我们获得了一种自动从网络学习强大深度物体模型的方法。我们通过在流行的机器人视觉基准数据库上使用我们源自网络的 ImageNet 版本进行物体分类实验,以及在移动机器人上进行终身物体发现任务,证实了我们方法的有效性。
引用
@article{arxiv.1702.08513,
title = {Learning Deep Visual Object Models From Noisy Web Data: How to Make it Work},
author = {Nizar Massouh and Francesca Babiloni and Tatiana Tommasi and Jay Young and Nick Hawes and Barbara Caputo},
journal= {arXiv preprint arXiv:1702.08513},
year = {2018}
}
备注
8 pages, 7 figures, 3 tables