中文

面向密集视频描述语义感知的预训练

计算机视觉与模式识别 2022-04-18 v1

摘要

本报告描述了我们在 ActivityNet Challenge 2021 中事件密集描述任务所采用方法的细节。我们提出了一种用于密集视频描述的语义感知预训练方法,其使所学特征能够识别高层语义概念。不同模态的多样视频特征被输入至事件描述模块以生成准确且有意义的句子。我们最终的集成模型在测试集上取得了 10.00 的 METEOR 分数。

关键词

引用

@article{arxiv.2204.07449,
  title  = {Semantic-Aware Pretraining for Dense Video Captioning},
  author = {Teng Wang and Zhu Liu and Feng Zheng and Zhichao Lu and Ran Cheng and Ping Luo},
  journal= {arXiv preprint arXiv:2204.07449},
  year   = {2022}
}

备注

The 2nd place solution to ActivityNet Event Dense-Captioning Challenge 2021