从生活方式视频博客到日常交互
计算机视觉与模式识别
2017-12-07 v1
摘要
在理解诸如起床或打开冰箱等基本人类交互方面取得进展的一个主要障碍是缺乏良好的训练数据。过去的大多数努力都显式地收集这些数据:从一长串动作标签开始,然后查询搜索引擎以获取带有每个标签的视频。在这项工作中,我们反其道而行之,进行隐式搜索:我们从一个大型的富含交互的视频数据集合开始,然后对其进行标注和分析。我们使用互联网生活方式视频博客(Lifestyle Vlogs)作为出人意料地庞大且多样的交互数据来源。我们表明,通过先收集数据,我们能够在动作和参与者方面实现更大的规模以及远为丰富的多样性。此外,我们的数据暴露了常见显式收集数据中内置的偏差。我们通过分析交互的核心组成部分——手——来理解我们的数据。我们对两项任务进行了基准测试:在视频级别识别语义物体接触,以及在帧级别识别非语义接触状态。我们还额外展示了对手的未来预测。
引用
@article{arxiv.1712.02310,
title = {From Lifestyle Vlogs to Everyday Interactions},
author = {David F. Fouhey and Wei-cheng Kuo and Alexei A. Efros and Jitendra Malik},
journal= {arXiv preprint arXiv:1712.02310},
year = {2017}
}
备注
Project page at: http://people.eecs.berkeley.edu/~dfouhey/2017/VLOG/