面向 VATEX 2020 描述生成挑战的多模态特征融合与特征注意力
计算机视觉与模式识别
2020-06-08 v1 机器学习
图像与视频处理
摘要
本报告描述了我们用于 VATEX Captioning Challenge 2020 的模型。首先,为从多领域收集信息,我们提取了运动、外观、语义与音频特征。随后我们设计了一个特征注意力模块,在解码时对不同的特征进行关注。我们应用了两类解码器,即自顶向下与 X-LAN,并集成这些模型以得到最终结果。所提方法以显著差距优于官方基线。我们在英文与中文私有测试集上分别取得 76.0 与 50.0 的 CIDEr 分数。我们在英文与中文私有测试排行榜上均排名第 2。
引用
@article{arxiv.2006.03315,
title = {Multi-modal Feature Fusion with Feature Attention for VATEX Captioning Challenge 2020},
author = {Ke Lin and Zhuoxin Gan and Liwei Wang},
journal= {arXiv preprint arXiv:2006.03315},
year = {2020}
}