利用网络图像搜索学习视频与句子的联合表示
计算机视觉与模式识别
2016-08-09 v1
摘要
我们的目标是基于自然语言查询的视频检索。此外,我们考虑类似的给定输入视频检索句子或生成描述的问题。近期工作通过将视觉与文本输入嵌入到语义相似性与距离相关的公共空间来解决该问题。我们也采用嵌入方法,并做出如下贡献:首先,在句子嵌入过程中利用网络图像搜索消除细粒度视觉概念的歧义。其次,我们提出句子、图像和视频输入的嵌入模型,其参数被同时学习。最后,我们展示所提模型如何应用于描述生成。总体而言,我们在视频与句子检索任务上观察到比最先进方法明显的改进。在描述生成中,性能水平与当前最先进相当,尽管我们的嵌入是为检索任务训练的。
引用
@article{arxiv.1608.02367,
title = {Learning Joint Representations of Videos and Sentences with Web Image Search},
author = {Mayu Otani and Yuta Nakashima and Esa Rahtu and Janne Heikkilä and Naokazu Yokoya},
journal= {arXiv preprint arXiv:1608.02367},
year = {2016}
}
备注
16 pages, 4th Workshop on Web-scale Vision and Social Media (VSM), ECCV 2016