中文

用于视频描述的多模态语义注意力网络

计算机视觉与模式识别 2019-05-09 v1

摘要

受视频中不同模态携带互补信息这一事实的启发,我们提出多模态语义注意力网络(MSAN),这是一种新的编码器-解码器框架,将多模态语义属性纳入视频描述。在编码阶段,我们通过将其表述为多标签分类问题来检测并生成多模态语义属性。此外,我们向模型添加辅助分类损失,以获得更有效的视觉特征和高级多模态语义属性分布,从而实现充分的视频编码。在解码阶段,我们将常规 LSTM 的每个权重矩阵扩展为属性依赖权重矩阵的集合,并采用注意力机制在描述过程的每个时刻关注不同属性。我们在两个流行的公共基准 MSVD 和 MSR-VTT 上评估算法,在六个评估指标上取得了与当前最先进方法相竞争的结果。

关键词

引用

@article{arxiv.1905.02963,
  title  = {Multimodal Semantic Attention Network for Video Captioning},
  author = {Liang Sun and Bing Li and Chunfeng Yuan and Zhengjun Zha and Weiming Hu},
  journal= {arXiv preprint arXiv:1905.02963},
  year   = {2019}
}

备注

6 pages, 4 figures, accepted by IEEE International Conference on Multimedia and Expo (ICME) 2019