中文

一种多尺度多示例视频描述网络

计算机视觉与模式识别 2016-03-22 v3

摘要

为野外视频生成自然语言描述是一项具有挑战性的任务。解决该问题的最先进方法大多借用现有深度卷积神经网络(CNN)架构(AlexNet、GoogLeNet)来提取输入视频的视觉表示。然而,这些深度CNN架构是为单标签居中目标分类设计的。尽管它们生成强大的语义特征,但缺乏允许检测帧中不同大小和位置多个目标的内在结构。我们的论文试图通过将基础CNN集成到若干全卷积神经网络(FCNs)中,形成一个处理原始图像中多个感受野大小的多尺度网络,来解决这个问题。FCNs此前应用于图像分割,与滑动窗口机制相比能高效生成类别热力图,并可轻松处理多尺度。为了进一步处理多个目标和位置的歧义,我们引入多示例学习机制(MIL)来同时考虑不同位置和不同尺度的目标。我们将多尺度多示例架构与序列到序列循环神经网络集成,以基于视觉表示生成句子描述。我们的架构是首个能够进行多尺度区域处理的端到端可训练架构。在Youtube视频数据集上的评估显示了我们的方法相对于原始单尺度整帧CNN模型的优势。我们灵活高效的架构有可能扩展以支持其他视频处理任务。

关键词

引用

@article{arxiv.1505.05914,
  title  = {A Multi-scale Multiple Instance Video Description Network},
  author = {Huijuan Xu and Subhashini Venugopalan and Vasili Ramanishka and Marcus Rohrbach and Kate Saenko},
  journal= {arXiv preprint arXiv:1505.05914},
  year   = {2016}
}

备注

ICCV15 workshop on Closing the Loop Between Vision and Language