中文

从文本预测视觉特征用于图像与视频字幕检索

计算机视觉与模式识别 2018-07-17 v3

摘要

本文致力于在一组句子中找出最能描述给定图像或视频内容的那一条。与依赖联合子空间进行图像和视频字幕检索的现有工作不同,我们提议仅在视觉空间中执行此任务。除了这一概念上的新颖性外,我们贡献了\emph{Word2VisualVec},一种从文本输入学习预测视觉特征表示的深度神经网络架构。示例字幕被编码为基于多尺度句子向量化的文本嵌入,并通过一个简单的多层感知机进一步迁移为所选择的深度视觉特征。我们进一步推广Word2VisualVec用于视频字幕检索,通过从文本预测三维卷积神经网络特征以及一种视觉-音频表示。在Flickr8k、Flickr30k、Microsoft Video Description数据集以及最新的用于视频字幕检索的NIST TrecVid挑战赛上的实验详述了Word2VisualVec的特性、其相对于文本嵌入的优势、多模态查询组合的潜力及其最先进的结果。

关键词

引用

@article{arxiv.1709.01362,
  title  = {Predicting Visual Features from Text for Image and Video Caption Retrieval},
  author = {Jianfeng Dong and Xirong Li and Cees G. M. Snoek},
  journal= {arXiv preprint arXiv:1709.01362},
  year   = {2018}
}

备注

Accepted by Transaction on Multimedia. Code is available at https://github.com/danieljf24/w2vv