联合定位与描述事件以实现密集视频描述
计算机视觉与模式识别
2018-04-24 v1
摘要
用自然语言自动描述视频被视为计算机视觉中的基本挑战。然而该问题并不简单,尤其当视频包含多个值得提及的事件时(这在真实视频中经常发生)。一个有效的问题是如何在时间上定位事件并随后加以描述,即所谓的“密集视频描述”。本文提出一种新颖的密集视频描述框架,通过端到端联合训练,统一了时间事件候选段的定位与每个候选段的句子生成。为结合这两个方面,我们将一种新设计,即描述性回归,集成到单阶段检测结构中,以通过句子生成推断每个检测候选段的描述复杂度。这进而调整了每个事件候选段的时间位置。我们的模型不同于现有密集视频描述方法,因为我们提出了检测与描述的联合全局优化,且该框架独特地利用了属性增强的视频描述架构。在 ActivityNet Captions 数据集上进行了大量实验,与最先进的技术相比,我们的框架显示出明显改进。更值得注意的是,我们在 ActivityNet Captions 官方测试集上取得了新纪录:METEOR 达 12.96%。
引用
@article{arxiv.1804.08274,
title = {Jointly Localizing and Describing Events for Dense Video Captioning},
author = {Yehao Li and Ting Yao and Yingwei Pan and Hongyang Chao and Tao Mei},
journal= {arXiv preprint arXiv:1804.08274},
year = {2018}
}
备注
CVPR 2018 Spotlight, Rank 1 in ActivityNet Captions Challenge 2017