中文

视频字幕中视觉特征及其加权加性融合的探索

计算机视觉与模式识别 2021-01-18 v1

摘要

视频字幕是一项热门任务,要求模型用自然语言描述视频中的事件。在本工作中,我们研究了从最先进的卷积神经网络导出的各种视觉特征表示捕捉高层语义上下文的能力。我们引入了带记忆增强编码器的加权加性融合 Transformer (WAFTM),这是一种在 transformer 编码器中融入记忆并使用一种新颖特征融合方法的字幕模型,该方法确保更重要的表示获得应有的重视。我们展示了通过应用 Word-Piece Tokenization 和一种流行的 REINFORCE 算法所实现的性能提升。最后,我们在两个数据集上对我们的模型进行基准测试,在 MSVD 上获得 92.4 的 CIDEr,在 ActivityNet Captions Dataset 上获得 0.091 的 METEOR。

关键词

引用

@article{arxiv.2101.05806,
  title  = {Exploration of Visual Features and their weighted-additive fusion for Video Captioning},
  author = {Praveen S and Akhilesh Bharadwaj and Harsh Raj and Janhavi Dadhania and Ganesh Samarth C. A and Nikhil Pareek and S R M Prasanna},
  journal= {arXiv preprint arXiv:2101.05806},
  year   = {2021}
}

备注

6 pages