中文

如何做一份 BLT 三明治?面向理解网络教学视频的推理学习

计算机视觉与模式识别 2018-12-07 v2

摘要

理解网络教学视频是视频理解的一个重要分支,体现在两方面。首先,大多数现有视频方法关注于持续几秒的短视频片段中的短期动作;这些方法不能直接应用于长视频。其次,与无约束的长视频(如电影)不同,教学视频更具结构性,其具有逐步流程来约束理解任务。在本文中,我们通过问答(QA)研究教学视频上的推理。令人惊讶的是,尽管其应用广泛,它并未成为视频领域的重点。因此我们引入 YouQuek,一个基于近期 YouCook2 的用于教学视频的标注 QA 数据集。YouQuek 中的问题不限于单帧上的线索,而是与时序维度上的逻辑推理相关。观察到缺乏用于建模长视频的有效表示,我们提出一组精心设计的模型,包括一种捕捉时序顺序与关系信息的新型循环图卷积网络(RGCN)。此外,我们研究包括描述与转录文本在内的多种模态,以提升视频理解。在 YouQuek 上的大量实验表明,RGCN 在 QA 准确率上表现最佳,且引入人工标注描述可获得更好性能。

关键词

引用

@article{arxiv.1812.00344,
  title  = {How to Make a BLT Sandwich? Learning to Reason towards Understanding Web Instructional Videos},
  author = {Shaojie Wang and Wentian Zhao and Ziyi Kou and Chenliang Xu},
  journal= {arXiv preprint arXiv:1812.00344},
  year   = {2018}
}