中文

录屏教程视频上的视频问答

计算与语言 2020-08-04 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

本文提出了一种针对录屏教程的新视频问答任务。我们引入了一个数据集,包含来自某软件教程视频的问题、答案与上下文三元组。与其他视频问答工作不同,我们数据集中的所有答案都基于领域知识库进行 grounding。设计了一种单次识别算法来提取视觉线索,有助于提升视频问答的性能。我们还基于数据集中视频上下文的多个方面提出了几种基线神经网络架构。实验结果表明,通过融合多模态上下文与领域知识,我们提出的模型显著提升了问答性能。

关键词

引用

@article{arxiv.2008.00544,
  title  = {Video Question Answering on Screencast Tutorials},
  author = {Wentian Zhao and Seokhwan Kim and Ning Xu and Hailin Jin},
  journal= {arXiv preprint arXiv:2008.00544},
  year   = {2020}
}