面向复杂视频分析的时间嵌入学习
计算机视觉与模式识别
2015-05-05 v1
摘要
本文中,我们提出学习视频帧的时间嵌入以用于复杂视频分析。大量未标注视频数据可以容易地从互联网获取。这些视频具有隐式的弱标签,即它们是时间和语义连贯的图像序列。我们利用这一信息,通过将帧与其出现的时间上下文相关联来学习视频帧的时间嵌入。为此,我们提出了一种基于视频中过去和未来帧来融入时间上下文的方案,并将其与其他上下文表示进行比较。此外,我们展示了使用多分辨率样本和困难负样本的数据增强如何显著改善所学嵌入的质量。我们评估了用于学习时间嵌入的各种设计决策,并表明我们的嵌入能够提升多个视频任务(如检索、分类以及无约束互联网视频中的时间顺序恢复)的性能。
引用
@article{arxiv.1505.00315,
title = {Learning Temporal Embeddings for Complex Video Analysis},
author = {Vignesh Ramanathan and Kevin Tang and Greg Mori and Li Fei-Fei},
journal= {arXiv preprint arXiv:1505.00315},
year = {2015}
}