中文

VATEX 2019 视频描述挑战赛:多模态信息融合与多阶段训练策略

计算与语言 2019-10-15 v1

摘要

多模态信息对描述视频中发生的事件至关重要。本工作中,我们以视频主题引导的多种表观、运动和音频信息来表示视频。遵循多阶段训练策略,我们的实验在 VATEX 基准上显示出稳定且显著的提升。本报告概述了为 VATEX 2019 视频描述挑战赛的中英文赛道所设计系统的架构并进行了对比分析。

关键词

引用

@article{arxiv.1910.05752,
  title  = {VATEX Captioning Challenge 2019: Multi-modal Information Fusion and Multi-stage Training Strategy for Video Captioning},
  author = {Ziqi Zhang and Yaya Shi and Jiutong Wei and Chunfeng Yuan and Bing Li and Weiming Hu},
  journal= {arXiv preprint arXiv:1910.05752},
  year   = {2019}
}