联合视频与文本解析以理解事件并回答查询
计算机视觉与模式识别
2014-02-24 v2 计算与语言
多媒体
摘要
我们提出了一个联合解析视频和文本的框架,用于理解事件并回答用户查询。我们的框架生成一个解析图,表示视频和文本中空间信息(物体和场景)、时间信息(动作和事件)以及因果信息(事件与流之间的因果关系)的组合结构。我们框架的知识表示基于时空因果与 - 或图(S/T/C-AOG),它联合建模了物体、场景和事件的可能层次组合及其相互作用和相互上下文,并指定了解析图的先验概率分布。我们提出了一种用于联合解析的概率生成模型,该模型捕捉了输入视频/文本、其对应的解析图以及联合解析图之间的关系。基于该概率模型,我们提出了一个由三个模块组成的联合解析系统:视频解析、文本解析和联合推理。视频解析和文本解析分别从输入视频和文本生成两个解析图。联合推理模块通过对视频和文本解析图执行匹配、推导和修正来生成联合解析图。所提出的框架具有以下目标:首先,我们旨在进行超越传统词袋方法的视频和文本深度语义解析;其次,我们基于联合 S/T/C-AOG 表示在空间、时间和因果维度上进行解析和推理;第三,我们展示了深度联合解析有助于后续应用,如生成叙述性文本描述以及回答谁、什么、何时、何地以及为何形式的查询。我们基于与真实值的比较以及查询回答的准确率对我们的系统进行了实证评估,并获得了令人满意的结果。
引用
@article{arxiv.1308.6628,
title = {Joint Video and Text Parsing for Understanding Events and Answering Queries},
author = {Kewei Tu and Meng Meng and Mun Wai Lee and Tae Eun Choe and Song-Chun Zhu},
journal= {arXiv preprint arXiv:1308.6628},
year = {2014}
}