中文

OVC-Net:基于时间图与细节增强的面向对象视频描述

计算机视觉与模式识别 2020-07-15 v5

摘要

传统视频描述要求对视频进行整体描述,但可能无法提供特定物体的详细表述。若不关联运动轨迹,这些基于图像的数据驱动方法无法从物体间视觉特征的时空转换中理解活动。此外,训练中使用模糊的片段-句子对,由于一对多的特性,不利于学习多模态功能映射。本文提出一项理解视频物体级内容的新任务,称为面向对象视频描述。我们引入基于视频的面向对象视频描述网络(OVC)-Net,通过时间图与细节增强,有效分析随时间变化的活动,并在小样本条件下稳定捕获视觉-语言关联。时间图相较以往基于图像的方法提供了有益补充,允许从视觉特征的时间演化与空间位置的动态运动中推理活动。细节增强有助于捕获不同物体间的判别性特征,后续描述模块可据此生成更具信息量与更精确的表述。此后,我们构建了一个提供一致物体-句子对的新数据集,以促进有效的跨模态学习。为证明有效性,我们在新数据集上开展实验,并与最先进视频描述方法比较。实验结果表明,OVC-Net 展现出精确描述并发物体的能力,并达到了最先进的性能。

关键词

引用

@article{arxiv.2003.03715,
  title  = {OVC-Net: Object-Oriented Video Captioning with Temporal Graph and Detail Enhancement},
  author = {Fangyi Zhu and Jenq-Neng Hwang and Zhanyu Ma and Guang Chen and Jun Guo},
  journal= {arXiv preprint arXiv:2003.03715},
  year   = {2020}
}