中文

面向深度场景与事件理解的受限视觉图灵测试

计算机视觉与模式识别 2015-12-17 v2 人工智能

摘要

本文提出一种受限视觉图灵测试(VTT),用于基于故事线的长期多摄像头捕获视频的深度理解。给定一组某场景(如多房间办公室、花园和停车场)的视频以及一系列基于故事线的查询,任务是以二元形式“真/假”(对极性查询)或准确的自然语言描述(对非极性查询)提供答案。查询(极性的或非极性的)包含基于视角的查询(可从特定摄像头视角回答)和以场景为中心的查询(涉及跨不同摄像头的联合推理)。故事线被收集以覆盖输入视频的空间、时间和因果理解。该数据和查询使我们的VTT区别于最近提出的图像视觉问答和视频字幕生成。提出了一个视觉系统来执行联合视频与查询解析,其集成了不同视觉模块、知识库和查询引擎。该系统为不同模块提供统一接口,以便单个模块可重新配置以测试新方法。我们提供了一个基准数据集和用于本体引导的故事线查询生成的工具包,包含约93.5小时在四个不同地点捕获的视频以及3426个查询分为127个故事线。我们还提供了基线实现和结果分析。

关键词

引用

@article{arxiv.1512.01715,
  title  = {A Restricted Visual Turing Test for Deep Scene and Event Understanding},
  author = {Hang Qi and Tianfu Wu and Mun-Wai Lee and Song-Chun Zhu},
  journal= {arXiv preprint arXiv:1512.01715},
  year   = {2015}
}