中文

融合时间与空间注意力用于 VATEX 2019 视频描述挑战赛

计算机视觉与模式识别 2019-10-16 v1 机器学习

摘要

本笔记论文介绍了我们在 VATEX 视频描述挑战赛中的模型。为捕捉视频中的多层次内容,我们提出融合时间注意力与空间注意力用于视频描述。时间注意力模块关注全局动作运动,而空间注意力模块能够描述更细粒度的物体。考虑到这两类注意力模块互补,我们通过后期融合策略将其融合。所提模型显著优于基线,在测试集上取得 73.4 的 CIDEr 分数,在 2019 年 VATEX 视频描述挑战赛排行榜上排名第二。

关键词

引用

@article{arxiv.1910.06737,
  title  = {Integrating Temporal and Spatial Attentions for VATEX Video Captioning Challenge 2019},
  author = {Shizhe Chen and Yida Zhao and Yuqing Song and Qin Jin and Qi Wu},
  journal= {arXiv preprint arXiv:1910.06737},
  year   = {2019}
}

备注

ICCV 2019 VATEX challenge