中文

ActivityNet 2019 任务3:探索视频中事件密集描述的环境上下文

计算机视觉与模式识别 2019-07-12 v1 计算与语言 机器学习

摘要

上下文推理对于理解长未修剪视频中的事件至关重要。本工作中,我们系统性地探索了用于视频中事件密集描述任务(旨在为未修剪视频中不同事件生成描述)的具有多种上下文的不同描述模型。我们提出了五类上下文以及两类事件描述模型,并从准确率和多样性两方面评估它们对事件描述的贡献。所提描述模型被接入我们的流水线系统以参与密集视频描述挑战赛。整体系统在视频中事件密集描述任务上取得当前最优性能,在挑战赛测试集上获得 9.91 的 METEOR 分数。

关键词

引用

@article{arxiv.1907.05092,
  title  = {Activitynet 2019 Task 3: Exploring Contexts for Dense Captioning Events in Videos},
  author = {Shizhe Chen and Yuqing Song and Yida Zhao and Qin Jin and Zhaoyang Zeng and Bei Liu and Jianlong Fu and Alexander Hauptmann},
  journal= {arXiv preprint arXiv:1907.05092},
  year   = {2019}
}

备注

Winner solution in CVPR 2019 Activitynet Dense Video Captioning challenge