用于视频字幕生成的分层模块化网络
计算机视觉与模式识别
2022-03-11 v3
摘要
视频字幕生成旨在根据内容生成自然语言描述,其中表示学习起着至关重要的作用。现有方法主要在监督学习框架内开发,通过将生成的字幕与真实文本逐词比较,而未充分利用语言语义。在这项工作中,我们提出了一个分层模块化网络,以在生成字幕之前从三个层次桥接视频表示和语言语义。具体而言,该层次结构包括: 实体层,突出显示最有可能在字幕中提及的对象; 谓词层,学习以突出显示的对象为条件的动作,并受字幕中谓词的监督; 句子层,学习全局语义表示并受整个字幕的监督。每个层次由一个模块实现。大量实验结果表明,所提出的方法在两个广泛使用的基准上表现优于 SOTA 模型:在 CIDEr 得分上,MSVD 为 104.0%,MSR-VTT 为 51.5%。
引用
@article{arxiv.2111.12476,
title = {Hierarchical Modular Network for Video Captioning},
author = {Hanhua Ye and Guorong Li and Yuankai Qi and Shuhui Wang and Qingming Huang and Ming-Hsuan Yang},
journal= {arXiv preprint arXiv:2111.12476},
year = {2022}
}
备注
Accepted by CVPR 2022