利用视频描述学习视频问答
计算机视觉与模式识别
2016-12-20 v2 人工智能
多媒体
摘要
我们提出一种可扩展的方法来学习基于视频的问答(QA):回答关于视频内容的“自由形式自然语言问题”。我们的方法自动收集网上免费提供的大量视频和描述。然后,从描述中自动生成大量候选QA对,而非手动标注。接下来,我们使用这些候选QA对来训练若干基于视频的QA方法,这些方法扩展自MN (Sukhbaatar et al. 2015)、VQA (Antol et al. 2015)、SA (Yao et al. 2015)、SS (Venugopalan et al. 2015)。为了处理不完美的候选QA对,我们提出一种自步学习(self-paced learning)过程来迭代识别它们并减轻其在训练中的影响。最后,我们在手动生成的基于视频的QA对上评估性能。结果表明我们的自步学习过程有效,且扩展的SS模型优于各种基线。
引用
@article{arxiv.1611.04021,
title = {Leveraging Video Descriptions to Learn Video Question Answering},
author = {Kuo-Hao Zeng and Tseng-Hung Chen and Ching-Yao Chuang and Yuan-Hong Liao and Juan Carlos Niebles and Min Sun},
journal= {arXiv preprint arXiv:1611.04021},
year = {2016}
}
备注
7 pages, 5 figures. Accepted to AAAI 2017. Camera-ready version