基于视频中物体交互定位的视频描述生成
计算机视觉与模式识别
2017-11-20 v1
摘要
我们通过将语言生成定位在视频中物体交互上,来解决视频描述生成问题。现有工作大多侧重于整体场景理解,往往对物体交互关注有限甚至未加关注,以应对视频理解问题。本文中,我们提出 SINet-Caption,它学习生成基于任意物体组之间高阶交互的定位描述,以实现细粒度视频理解。我们讨论了该方法的挑战与益处。我们进一步使用基于该方法的模型 SINet-Caption 在 ActivityNet Captions 数据集上展示了最先进的结果。
引用
@article{arxiv.1711.06354,
title = {Grounded Objects and Interactions for Video Captioning},
author = {Chih-Yao Ma and Asim Kadav and Iain Melvin and Zsolt Kira and Ghassan AlRegib and Hans Peter Graf},
journal= {arXiv preprint arXiv:1711.06354},
year = {2017}
}
备注
arXiv admin note: substantial text overlap with arXiv:1711.06330