中文

MECCANO 数据集:从工业类领域第一视角视频理解人-物交互

计算机视觉与模式识别 2020-10-13 v1

摘要

可穿戴相机能够采集人类与世界交互的图像与视频。尽管第三人称视觉中的人-物交互已被深入研究,该问题在第一视角设定与工业场景中却研究不足。为填补此空白,我们引入 MECCANO,首个用于研究工业类设定下人-物交互的第一视角视频数据集。MECCANO 由 20 名参与者采集,他们被要求组装摩托车模型,为此必须与微小物体和工具交互。该数据集已针对从第一视角识别人-物交互的任务进行了显式标注。具体而言,每次交互均在时间上(以动作片段)与空间上(以主动物体边界框)进行了标注。利用所提数据集,我们探究了四项不同任务,包括 1)动作识别,2)主动物体检测,3)主动物体识别,以及 4)第一视角人-物交互检测,其为标准人-物交互检测任务的改进版本。基线结果表明,MECCANO 数据集是研究工业类场景中第一视角人-物交互的一项具挑战性基准。我们在 https://iplab.dmi.unict.it/MECCANO 公开发布该数据集。

关键词

引用

@article{arxiv.2010.05654,
  title  = {The MECCANO Dataset: Understanding Human-Object Interactions from Egocentric Videos in an Industrial-like Domain},
  author = {Francesco Ragusa and Antonino Furnari and Salvatore Livatino and Giovanni Maria Farinella},
  journal= {arXiv preprint arXiv:2010.05654},
  year   = {2020}
}