中文

家庭好莱坞:面向活动理解的众包数据收集

计算机视觉与模式识别 2016-07-28 v3

摘要

计算机视觉在通过寻找丢失的钥匙、浇花或提醒我们吃药来辅助日常生活方面具有巨大潜力。要成功完成此类任务,计算机视觉方法需要由我们日常动态场景的真实且多样的示例训练而成。尽管此类场景大多并不特别引人注目,但它们通常不会出现在YouTube、电影或电视广播中。那么我们如何收集足够多且多样但平淡无奇的代表我们生活的样本?我们提出了一种新颖的“家庭好莱坞”(Hollywood in Homes)方法来收集此类数据。我们不在实验室拍摄视频,而是通过分发并众包从脚本编写到视频录制和标注的整个视频创建过程来确保多样性。遵循此流程,我们收集了一个新数据集Charades,数百人在自己家中录制视频,演绎随意的日常活动。该数据集由9,848个标注视频组成,平均时长30秒,展示了来自三大洲的267人的活动。每个视频由多条自由文本描述、动作标签、动作间隔和交互物体类别进行标注。总体而言,Charades提供了27,847条视频描述、针对157个动作类的66,500个时间局部化间隔,以及针对46个物体类的41,104个标签。利用这一丰富数据,我们评估并提供了包括动作识别和自动描述生成在内的若干任务的基线结果。我们相信该数据集的真实感、多样性和随意性将为计算机视觉界带来独特挑战与新机遇。

关键词

引用

@article{arxiv.1604.01753,
  title  = {Hollywood in Homes: Crowdsourcing Data Collection for Activity Understanding},
  author = {Gunnar A. Sigurdsson and Gül Varol and Xiaolong Wang and Ali Farhadi and Ivan Laptev and Abhinav Gupta},
  journal= {arXiv preprint arXiv:1604.01753},
  year   = {2016}
}