中文

面向视频描述的双向时序图对象感知聚合方法

计算机视觉与模式识别 2019-06-12 v1

摘要

视频描述旨在自动生成视频内容的自然语言描述,近年来引起了广泛关注。生成准确且细粒度的描述不仅需要理解视频的全局内容,还需要捕获详细的对象信息。同时,视频表示对生成描述的质量有巨大影响。因此,对于视频描述而言,捕获显著对象及其详细的时序动态,并使用有判别力的时空表示来表征它们至关重要。本文提出了一种基于双向时序图对象感知聚合(OA-BTG)的新型视频描述方法,该方法捕获视频中显著对象的详细时序动态,并通过对检测到的对象区域执行对象感知的局部特征聚合来学习有判别力的时空表示。主要创新点和优势在于:(1)双向时序图:沿时间顺序和逆时间顺序构建双向时序图,为捕获每个显著对象的时序轨迹提供了互补的方式。(2)对象感知聚合:在对象时序轨迹和全局帧序列上构建可学习的VLAD(局部聚合描述子向量)模型,执行对象感知聚合以学习有判别力的表示。还开发了一种层次化注意力机制来区分多个对象的不同贡献。在两个广泛使用的数据集上的实验表明,我们的OA-BTG在BLEU@4、METEOR和CIDEr指标上达到了最先进的性能。

关键词

引用

@article{arxiv.1906.04375,
  title  = {Object-aware Aggregation with Bidirectional Temporal Graph for Video Captioning},
  author = {Junchao Zhang and Yuxin Peng},
  journal= {arXiv preprint arXiv:1906.04375},
  year   = {2019}
}

备注

10 pages, accepted by IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2019