中文

基于视频中物体交互定位的视频描述生成

计算机视觉与模式识别 2017-11-20 v1

摘要

我们通过将语言生成定位在视频中物体交互上,来解决视频描述生成问题。现有工作大多侧重于整体场景理解,往往对物体交互关注有限甚至未加关注,以应对视频理解问题。本文中,我们提出 SINet-Caption,它学习生成基于任意物体组之间高阶交互的定位描述,以实现细粒度视频理解。我们讨论了该方法的挑战与益处。我们进一步使用基于该方法的模型 SINet-Caption 在 ActivityNet Captions 数据集上展示了最先进的结果。

关键词

引用

@article{arxiv.1711.06354,
  title  = {Grounded Objects and Interactions for Video Captioning},
  author = {Chih-Yao Ma and Asim Kadav and Iain Melvin and Zsolt Kira and Ghassan AlRegib and Hans Peter Graf},
  journal= {arXiv preprint arXiv:1711.06354},
  year   = {2017}
}

备注

arXiv admin note: substantial text overlap with arXiv:1711.06330