通过填空式问答理解视频数据的数据集与模型探索
计算机视觉与模式识别
2017-02-07 v2
摘要
尽管深度卷积神经网络在涉及静态图像的基准任务中经常接近或达到人类水平的表现,但将这种成功扩展到运动图像并非易事。能够学习理解视频的模型对许多应用具有重要意义,包括内容推荐、预测、摘要、事件/对象检测以及理解人类视觉感知,但许多领域缺乏足够的数据来探索和完善视频模型。为了满足开发和理解视频对简单、定量基准的需求,我们提出了 MovieFIB,这是一个包含超过 300,000 个示例的填空式问答数据集,基于面向视觉障碍者的描述性视频标注。除了展示数据集的统计信息和描述外,我们对 5 种不同模型的预测进行了详细分析,并将其与人类表现进行比较。我们研究了语言、静态(2D)视觉特征和动态(3D)视觉特征的相对重要性;数据集规模增大、采样帧数增加以及词汇表大小的影响。我们表明:仅靠语言模型无法解决此任务;我们结合 2D 和 3D 视觉信息的模型确实提供了最佳结果;所有模型的表现均显著低于人类水平。我们提供了对不同模型给出响应的人工评估,并发现在 MovieFIB 评估上的准确率与人类判断高度一致。我们提出了改进视频模型的途径,并希望所提出的数据集能有助于衡量和推动这一非常有趣领域的进展。
引用
@article{arxiv.1611.07810,
title = {A dataset and exploration of models for understanding video data through fill-in-the-blank question-answering},
author = {Tegan Maharaj and Nicolas Ballas and Anna Rohrbach and Aaron Courville and Christopher Pal},
journal= {arXiv preprint arXiv:1611.07810},
year = {2017}
}