ActivityNet 2019 任务3:探索视频中事件密集描述的环境上下文
计算机视觉与模式识别
2019-07-12 v1 计算与语言
机器学习
摘要
上下文推理对于理解长未修剪视频中的事件至关重要。本工作中,我们系统性地探索了用于视频中事件密集描述任务(旨在为未修剪视频中不同事件生成描述)的具有多种上下文的不同描述模型。我们提出了五类上下文以及两类事件描述模型,并从准确率和多样性两方面评估它们对事件描述的贡献。所提描述模型被接入我们的流水线系统以参与密集视频描述挑战赛。整体系统在视频中事件密集描述任务上取得当前最优性能,在挑战赛测试集上获得 9.91 的 METEOR 分数。
引用
@article{arxiv.1907.05092,
title = {Activitynet 2019 Task 3: Exploring Contexts for Dense Captioning Events in Videos},
author = {Shizhe Chen and Yuqing Song and Yida Zhao and Qin Jin and Zhaoyang Zeng and Bei Liu and Jianlong Fu and Alexander Hauptmann},
journal= {arXiv preprint arXiv:1907.05092},
year = {2019}
}
备注
Winner solution in CVPR 2019 Activitynet Dense Video Captioning challenge