用于 VATEX 2020 视频描述挑战赛的 NITS-VC 系统
计算机视觉与模式识别
2020-09-28 v2
摘要
视频描述是将视频的内容、事件和动作总结为简短文本形式的过程,这在视频引导机器翻译、视频情感分析以及为需要帮助的个人提供支持等诸多研究领域中都有助益。本文介绍了用于 VATEX-2020 视频描述挑战赛的框架系统描述。我们采用基于编码器-解码器的方法,其中视频的视觉特征使用三维卷积神经网络(C3D)进行编码,在解码阶段使用两个长短期记忆(LSTM)循环网络,分别融合视觉特征和输入描述,并通过两个 LSTM 输出的逐元素乘积生成最终结果。我们的模型在公开和私有测试集上分别取得了 0.20 和 0.22 的 BLEU 分数。
引用
@article{arxiv.2006.04058,
title = {NITS-VC System for VATEX Video Captioning Challenge 2020},
author = {Alok Singh and Thoudam Doren Singh and Sivaji Bandyopadhyay},
journal= {arXiv preprint arXiv:2006.04058},
year = {2020}
}
备注
Workshop on Language & Vision with applications to Video Understanding (LVVU 2020) - In conjunction with CVPR 2020