学习离散组合推理模块网络用于视频描述生成
计算机视觉与模式识别
2020-07-20 v1
摘要
为视频生成自然语言描述(即视频描述生成)本质上需要在生成过程中逐步推理。例如,要生成句子“一个男人正在投篮球”,我们需要先定位并描述主体“男人”,接着推理出该男人正在“投”,然后描述投的宾语“篮球”。然而,为视觉问答设计的现有视觉推理方法并不适用于视频描述生成,因为其需要在时空上对视频进行更复杂的视觉推理,以及沿生成过程的动态模块组合。本文中,我们提出一种用于视频描述生成的新型视觉推理方法,称为推理模块网络(RMN),以使现有编码器-解码器框架具备上述推理能力。具体而言,我们的 RMN 采用 1)三个精细的时空推理模块,以及 2)一个由带 Gumbel 近似的语言损失训练的动态离散模块选择器。在 MSVD 与 MSR-VTT 数据集上的大量实验表明,所提 RMN 优于 SOTA 方法,同时提供显式且可解释的生成过程。我们的代码见 https://github.com/tgc1997/RMN。
引用
@article{arxiv.2007.09049,
title = {Learning to Discretely Compose Reasoning Module Networks for Video Captioning},
author = {Ganchao Tan and Daqing Liu and Meng Wang and Zheng-Jun Zha},
journal= {arXiv preprint arXiv:2007.09049},
year = {2020}
}
备注
Accepted at IJCAI 2020 Main Track. Sole copyright holder is IJCAI. Code is available at https://github.com/tgc1997/RMN