揭示视频问答中的时间上下文
计算机视觉与模式识别
2015-11-17 v1
摘要
在这项工作中,我们引入时间域上的视频问答,以推断过去、描述现在并预测未来。我们提出一种使用循环神经网络的编码器-解码器方法,以学习视频的时间结构,并引入双通道排序损失来回答选择题。我们探索了利用“填空”问题形式更精细理解视频内容的方法,并从 TACoS、MPII-MD、MEDTest 14 数据集收集了时长超过 1000 小时的 109,895 个视频片段,相应的 390,744 个问题由标注生成。大量实验表明,我们的方法显著优于所对比的基线。
引用
@article{arxiv.1511.04670,
title = {Uncovering Temporal Context for Video Question and Answering},
author = {Linchao Zhu and Zhongwen Xu and Yi Yang and Alexander G. Hauptmann},
journal= {arXiv preprint arXiv:1511.04670},
year = {2015}
}