融合时间与空间注意力用于 VATEX 2019 视频描述挑战赛
计算机视觉与模式识别
2019-10-16 v1 机器学习
摘要
本笔记论文介绍了我们在 VATEX 视频描述挑战赛中的模型。为捕捉视频中的多层次内容,我们提出融合时间注意力与空间注意力用于视频描述。时间注意力模块关注全局动作运动,而空间注意力模块能够描述更细粒度的物体。考虑到这两类注意力模块互补,我们通过后期融合策略将其融合。所提模型显著优于基线,在测试集上取得 73.4 的 CIDEr 分数,在 2019 年 VATEX 视频描述挑战赛排行榜上排名第二。
引用
@article{arxiv.1910.06737,
title = {Integrating Temporal and Spatial Attentions for VATEX Video Captioning Challenge 2019},
author = {Shizhe Chen and Yida Zhao and Yuqing Song and Qin Jin and Qi Wu},
journal= {arXiv preprint arXiv:1910.06737},
year = {2019}
}
备注
ICCV 2019 VATEX challenge