中文

Word2VisualVec:通过视觉特征预测实现图像与视频到句子的匹配

计算机视觉与模式识别 2016-11-28 v2

摘要

本文力求找到最好描述图像或视频内容的句子。与依赖于图像/视频到句子匹配的共同子空间现有工作不同,我们提出仅在视觉空间中这样做。我们贡献 Word2VisualVec,一种深度神经网络架构,基于句子向量化和多层感知机学习预测文本输入的深度视觉编码。我们通过改变句子向量化策略、网络深度以及为图像到句子匹配所预测的深度特征,彻底分析其架构设计。我们还将 Word2VisualVec 推广到视频到句子的匹配,通过将预测能力扩展到 3-D ConvNet 特征以及视听表示。在四个具有挑战性的图像和视频基准上的实验详细说明了 Word2VisualVec 的性质、图像和视频到句子匹配的能力,以及在所有数据集上其最先进(state-of-the-art)结果。

关键词

引用

@article{arxiv.1604.06838,
  title  = {Word2VisualVec: Image and Video to Sentence Matching by Visual Feature Prediction},
  author = {Jianfeng Dong and Xirong Li and Cees G. M. Snoek},
  journal= {arXiv preprint arXiv:1604.06838},
  year   = {2016}
}