Best Vision Technologies 参加 ActivityNet Challenge 2018 的方案——任务:视频中事件密集描述
计算机视觉与模式识别
2018-06-26 v1
摘要
本说明描述了我们解决 ActivityNet Challenge 2018 视频中事件密集描述任务的方案细节。具体而言,我们以两阶段方式解决该问题,即先时序事件提议再句子生成。对于时序事件提议,我们直接利用文献 [13, 16] 中的三阶段流程。对于句子生成,我们采用基于 LSTM 的带时序注意力机制的描述框架(称为 LSTM-T)。此外,输入至基于 LSTM 的视频描述模型的视觉序列由 RGB 与光流图像组成。在推理时,我们采用后融合策略融合两个基于 LSTM 的描述模型以生成句子。
引用
@article{arxiv.1806.09278,
title = {Best Vision Technologies Submission to ActivityNet Challenge 2018-Task: Dense-Captioning Events in Videos},
author = {Yuan Liu and Moyini Yao},
journal= {arXiv preprint arXiv:1806.09278},
year = {2018}
}
备注
Rank 2 in ActivityNet Captions Challenge 2018