中文

所见即所言:视频中的句子引导活动识别

计算机视觉与模式识别 2014-05-29 v2 人工智能 计算与语言

摘要

我们展示了一个系统,演示了事件的结构化组成与语言的结构化组成如何相互作用,并与视频动作识别中的底层聚焦机制协同工作,从而不仅为自顶向下和自底向上的整合提供了媒介,也为视觉与语言之间的多模态整合提供了媒介。我们展示了参与者(名词)、其特征(形容词)、执行的动作(动词)、动作的方式(副词)以及参与者之间变化的空间关系(介词)在由语法介导的完整句子描述形式中所扮演的角色,如何引导活动识别过程。此外,通过在多活动视频领域执行三个独立任务——句子引导的注意力聚焦、视频句子描述生成以及基于查询的视频搜索——仅仅通过以不同方式利用该框架,我们就证明了该框架的实用性和表达能力。

关键词

引用

@article{arxiv.1308.4189,
  title  = {Seeing What You're Told: Sentence-Guided Activity Recognition In Video},
  author = {N. Siddharth and Andrei Barbu and Jeffrey Mark Siskind},
  journal= {arXiv preprint arXiv:1308.4189},
  year   = {2014}
}

备注

To appear in CVPR 2014