中文

用于学习与评估视觉常识的“something something”视频数据库

计算机视觉与模式识别 2017-06-19 v2

摘要

在 ImageNet 等数据集上训练的神经网络推动了视觉物体分类的重大进展。阻碍网络对复杂场景和情境进行更深层推理,以及像人类那样将视觉知识与自然语言整合的一个障碍,是它们缺乏关于物理世界的常识知识。与静态图像不同,视频包含关于物理世界的大量详细信息。然而,大多数标注视频数据集表示的是高层概念,而非关于动作和场景的详细物理层面。在本工作中,我们描述了正在进行的“something-something”视频预测任务数据库的收集工作,这些任务的求解需要对所描绘情境的常识理解。该数据库目前包含跨越 174 个类别的超过 100,000 个视频,这些类别被定义为字幕模板。我们还描述了大规模众包此数据时面临的挑战。

关键词

引用

@article{arxiv.1706.04261,
  title  = {The "something something" video database for learning and evaluating visual common sense},
  author = {Raghav Goyal and Samira Ebrahimi Kahou and Vincent Michalski and Joanna Materzyńska and Susanne Westphal and Heuna Kim and Valentin Haenel and Ingo Fruend and Peter Yianilos and Moritz Mueller-Freitag and Florian Hoppe and Christian Thurau and Ingo Bax and Roland Memisevic},
  journal= {arXiv preprint arXiv:1706.04261},
  year   = {2017}
}