VATEX 2019 视频描述挑战赛:多模态信息融合与多阶段训练策略
计算与语言
2019-10-15 v1
摘要
多模态信息对描述视频中发生的事件至关重要。本工作中,我们以视频主题引导的多种表观、运动和音频信息来表示视频。遵循多阶段训练策略,我们的实验在 VATEX 基准上显示出稳定且显著的提升。本报告概述了为 VATEX 2019 视频描述挑战赛的中英文赛道所设计系统的架构并进行了对比分析。
引用
@article{arxiv.1910.05752,
title = {VATEX Captioning Challenge 2019: Multi-modal Information Fusion and Multi-stage Training Strategy for Video Captioning},
author = {Ziqi Zhang and Yaya Shi and Jiutong Wei and Chunfeng Yuan and Bing Li and Weiming Hu},
journal= {arXiv preprint arXiv:1910.05752},
year = {2019}
}