中文

面向 VATEX 2020 描述生成挑战的多模态特征融合与特征注意力

计算机视觉与模式识别 2020-06-08 v1 机器学习 图像与视频处理

摘要

本报告描述了我们用于 VATEX Captioning Challenge 2020 的模型。首先,为从多领域收集信息,我们提取了运动、外观、语义与音频特征。随后我们设计了一个特征注意力模块,在解码时对不同的特征进行关注。我们应用了两类解码器,即自顶向下与 X-LAN,并集成这些模型以得到最终结果。所提方法以显著差距优于官方基线。我们在英文与中文私有测试集上分别取得 76.0 与 50.0 的 CIDEr 分数。我们在英文与中文私有测试排行榜上均排名第 2。

关键词

引用

@article{arxiv.2006.03315,
  title  = {Multi-modal Feature Fusion with Feature Attention for VATEX Captioning Challenge 2020},
  author = {Ke Lin and Zhuoxin Gan and Liwei Wang},
  journal= {arXiv preprint arXiv:2006.03315},
  year   = {2020}
}