中文

利用视频描述学习视频问答

计算机视觉与模式识别 2016-12-20 v2 人工智能 多媒体

摘要

我们提出一种可扩展的方法来学习基于视频的问答(QA):回答关于视频内容的“自由形式自然语言问题”。我们的方法自动收集网上免费提供的大量视频和描述。然后,从描述中自动生成大量候选QA对,而非手动标注。接下来,我们使用这些候选QA对来训练若干基于视频的QA方法,这些方法扩展自MN (Sukhbaatar et al. 2015)、VQA (Antol et al. 2015)、SA (Yao et al. 2015)、SS (Venugopalan et al. 2015)。为了处理不完美的候选QA对,我们提出一种自步学习(self-paced learning)过程来迭代识别它们并减轻其在训练中的影响。最后,我们在手动生成的基于视频的QA对上评估性能。结果表明我们的自步学习过程有效,且扩展的SS模型优于各种基线。

关键词

引用

@article{arxiv.1611.04021,
  title  = {Leveraging Video Descriptions to Learn Video Question Answering},
  author = {Kuo-Hao Zeng and Tseng-Hung Chen and Ching-Yao Chuang and Yuan-Hong Liao and Juan Carlos Niebles and Min Sun},
  journal= {arXiv preprint arXiv:1611.04021},
  year   = {2016}
}

备注

7 pages, 5 figures. Accepted to AAAI 2017. Camera-ready version