中文

基于跨模态自注意力网络学习的视频问题生成

计算机视觉与模式识别 2020-02-18 v3 计算与语言

摘要

我们引入一项新任务:视频问题生成(Video QG)。视频 QG 模型在给定视频片段及其对应对话时自动生成问题。视频 QG 需要一系列技能——句子理解、时间关系、视觉与语言的交互,以及提出有意义问题的能力。为此,我们提出一种新颖的语义丰富跨模态自注意力(SRCMSA)网络来聚合多模态和多样化特征。更确切地说,我们通过整合对象级信息来增强视频帧的语义,并共同考虑视频问题生成任务的跨模态注意力。令人振奋的是,我们提出的模型在 TVQA 数据集上将基线 BLEU-4 分数从 7.58 显著提升至 14.48。最重要的是,我们可谓为理解具挑战性的视频输入铺就了一条新路径,并从多样性角度提供了详细分析,为未来研究开辟了途径。

关键词

引用

@article{arxiv.1907.03049,
  title  = {Video Question Generation via Cross-Modal Self-Attention Networks Learning},
  author = {Yu-Siang Wang and Hung-Ting Su and Chen-Hsi Chang and Zhe-Yu Liu and Winston H. Hsu},
  journal= {arXiv preprint arXiv:1907.03049},
  year   = {2020}
}

备注

Accepted by ICASSP 2020