中文

视频中的弱监督密集事件描述

计算机视觉与模式识别 2018-12-11 v1

摘要

密集事件描述旨在检测并描述视频中包含的所有感兴趣事件。尽管该领域已取得先进进展,现有方法利用密集时间标注来解决此任务,而这极其耗费资源。本文提出一个新问题:弱监督密集事件描述,其不需要时间片段标注用于模型训练。我们的解决方案基于一一对应假设,即每个描述对应一个时间片段,且每个时间片段有一句描述,这在当前基准数据集与大多数真实世界情形中成立。我们将该问题分解为一对对偶问题:事件描述与句子定位,并提出一个循环系统来训练我们的模型。提供了大量实验结果以证明我们的模型在视频密集事件描述与句子定位上的能力。

关键词

引用

@article{arxiv.1812.03849,
  title  = {Weakly Supervised Dense Event Captioning in Videos},
  author = {Xuguang Duan and Wenbing Huang and Chuang Gan and Jingdong Wang and Wenwu Zhu and Junzhou Huang},
  journal= {arXiv preprint arXiv:1812.03849},
  year   = {2018}
}

备注

NeurIPS 2018