视频输入,句子输出
计算机视觉与模式识别
2014-08-28 v1 计算与语言
信息检索
摘要
我们提出了一种生成视频句子描述的系统:谁对谁做了什么,以及在哪里和如何做的。动作类别被渲染为动词,参与对象被渲染为名词短语,这些对象的属性被渲染为名词短语中的形容词修饰语,参与者之间的空间关系被渲染为介词短语,事件特征被渲染为介词短语状语和副词修饰语。提取渲染这些语言实体所需的信息需要一种事件识别方法,该方法能够恢复对象轨迹、轨迹到角色的分配以及变化的身体姿态。
引用
@article{arxiv.1408.6418,
title = {Video In Sentences Out},
author = {Andrei Barbu and Alexander Bridge and Zachary Burchill and Dan Coroian and Sven Dickinson and Sanja Fidler and Aaron Michaux and Sam Mussman and Siddharth Narayanaswamy and Dhaval Salvi and Lara Schmidt and Jiangnan Shangguan and Jeffrey Mark Siskind and Jarrell Waggoner and Song Wang and Jinlian Wei and Yifan Yin and Zhiqi Zhang},
journal= {arXiv preprint arXiv:1408.6418},
year = {2014}
}
备注
Appears in Proceedings of the Twenty-Eighth Conference on Uncertainty in Artificial Intelligence (UAI2012)