中文

眼中的故事:用于高效视频到语言翻译的上下文视觉交互

计算机视觉与模式识别 2015-11-23 v1 计算与语言

摘要

整合更高层次的视觉和语言解释是人类智能的核心。随着图像中自动视觉类别识别接近人类表现,视频动态时空域的高层理解及其到自然语言的转换仍远未解决。虽然大多数视觉到文本翻译的工作使用预学习或预建立的计算语言模型,本文提出一种仅使用视觉来高效学习如何将视频内容翻译成语言的方法。我们以简单形式发现由主要角色扮演的故事,同时仅使用视觉线索来表示物体及其交互。我们的方法以分层方式学习更高层表示,用于识别涉及的主体、动作和物体、它们相关的上下文背景以及它们随时间的交互。我们有三阶段方法:首先我们考虑局部外观层面的个体实体特征,然后我们考虑这些物体和动作及其视频背景之间的关系,第三,我们将它们的时空关系作为最高解释层分类器的输入。因此,我们的方法基于从训练数据直接学习的整体视觉故事中扮演的角色,找到由主体、动词和物体组成的连贯语言描述,而不使用已知语言模型。我们在包含野外YouTube片段的大规模数据集上测试了方法的效率,并展示了最先进的性能,通常优于使用更复杂预学习语言知识的当前方法。

关键词

引用

@article{arxiv.1511.06674,
  title  = {Stories in the Eye: Contextual Visual Interactions for Efficient Video to Language Translation},
  author = {Anirudh Goyal and Marius Leordeanu},
  journal= {arXiv preprint arXiv:1511.06674},
  year   = {2015}
}