中文

基于上下文门控的双向注意力融合用于密集视频描述

计算机视觉与模式识别 2018-04-04 v2

摘要

密集视频描述是一项新兴任务,旨在定位并描述视频中的所有事件。我们识别并应对该任务的两个挑战,即(1)如何利用过去与未来上下文进行准确的事件提案预测,以及(2)如何为解码器构建信息丰富的输入以生成自然的事件描述。首先,以往工作主要以前向方向生成时间事件提案,忽略了未来视频上下文。我们提出一种双向提案方法,有效利用过去与未来上下文进行提案预测。其次,以往工作中不同在(近乎)同一时间结束的事件无法区分,导致生成相同描述。我们通过以提案模块隐藏状态与视频内容(如 C3D 特征)的注意力融合来表示每个事件,解决了该问题。我们进一步提出一种新颖的上下文门控机制,动态平衡当前事件与其周围上下文的贡献。我们通过实验表明,我们的注意力融合事件表示优于单独的提案隐藏状态或视频内容。通过将提案与描述模块耦合进统一框架,我们的模型在 ActivityNet Captions 数据集上以超过 100% 的相对增益优于现有最优方法(Meteor 分数从 4.82 提升至 9.65)。

关键词

引用

@article{arxiv.1804.00100,
  title  = {Bidirectional Attentive Fusion with Context Gating for Dense Video Captioning},
  author = {Jingwen Wang and Wenhao Jiang and Lin Ma and Wei Liu and Yong Xu},
  journal= {arXiv preprint arXiv:1804.00100},
  year   = {2018}
}

备注

CVPR2018 spotlight paper