视频输入,句子输出
计算机视觉与模式识别
2012-04-13 v1 人工智能
摘要
我们提出了一种系统,能够生成视频的句子描述:谁对谁做了什么,以及他们在何处、如何做的。动作类别被渲染为动词,参与对象被渲染为名词短语,这些对象的属性被渲染为名词短语中的形容词修饰语,参与者之间的空间关系被渲染为介词短语,而事件特征则被渲染为介词短语状语和副词修饰语。提取渲染这些语言实体所需的信息,需要一种能够恢复对象轨迹、轨迹到角色的分配以及身体姿态变化的事件识别方法。
引用
@article{arxiv.1204.2742,
title = {Video In Sentences Out},
author = {Andrei Barbu and Alexander Bridge and Zachary Burchill and Dan Coroian and Sven Dickinson and Sanja Fidler and Aaron Michaux and Sam Mussman and Siddharth Narayanaswamy and Dhaval Salvi and Lara Schmidt and Jiangnan Shangguan and Jeffrey Mark Siskind and Jarrell Waggoner and Song Wang and Jinlian Wei and Yifan Yin and Zhiqi Zhang},
journal= {arXiv preprint arXiv:1204.2742},
year = {2012}
}