Toybox:自我中心视觉对象变换数据集
计算机视觉与模式识别
2018-11-28 v3
摘要
在对象识别研究中,许多常用数据集(如 ImageNet 及类似数据集)包含的对象实例和视角分布相对稀疏,例如,可能看到一千只不同长颈鹿的一千张不同照片,且大多从少数常规拍摄角度取景。这些分布特性限制了能够用此类数据集进行的计算实验类型,并且也不反映具身视觉体验的自然模式。作为为弥补这一差距而创建的少数(但渐增的)多视角对象数据集之一,我们引入一个名为 Toybox 的新视频数据集,其中包含常见家用物品和玩具被手动操控以经历结构化变换(如旋转、平移和缩放)的自我中心(即第一人称视角)视频。为说明 Toybox 的潜在用途,我们还展示了初步的神经网络实验,考察 1) 在不同对象实例和视角分布上训练如何影响识别性能,以及 2) 视角依赖的对象概念如何在训练网络的隐藏层中表示。
引用
@article{arxiv.1806.06034,
title = {The Toybox Dataset of Egocentric Visual Object Transformations},
author = {Xiaohan Wang and Tengyu Ma and James Ainooson and Seunghwan Cha and Xiaotian Wang and Azhar Molla and Maithilee Kunda},
journal= {arXiv preprint arXiv:1806.06034},
year = {2018}
}