视频集合的无监督语义解析
计算机视觉与模式识别
2016-01-28 v4
摘要
人类交流通常具有底层结构。这反映在许多用户生成视频中可识别出一个起点、终点以及两者之间某些客观步骤的事实。在本文中,我们提出一种以无监督方式将视频解析为此类语义步骤的方法。所提方法能够提供由视频的客观步骤构成的语义“故事线”。我们通过在一个联合生成模型中同时使用视觉与语言线索来实现这一点。所提方法还能为每一个已识别的语义步骤和视频片段提供文本描述。我们在大量复杂的 YouTube 视频上评估了该方法,并展示了针对这一复杂且重要问题的前所未有的高质量结果。
引用
@article{arxiv.1506.08438,
title = {Unsupervised Semantic Parsing of Video Collections},
author = {Ozan Sener and Amir Zamir and Silvio Savarese and Ashutosh Saxena},
journal= {arXiv preprint arXiv:1506.08438},
year = {2016}
}