中文

TutorialVQA:面向教程视频的问答数据集

计算与语言 2020-06-02 v2

摘要

尽管当前已有若干视频问答数据集可用,但仍亟需一个涉及多步骤与非事实型答案的数据集。此外,依赖视频转录文本仍是一个未被充分探索的课题。为妥善应对这一点,我们提出了一种针对教学视频的问答新任务,因其具有冗长且叙述性的特点。先前视频问答研究侧重于给定问题与视频片段后生成短文本作为答案,而我们的任务旨在定位一段视频片段区间作为答案,其中包含不同粒度的教学细节。本工作聚焦于有关图像编辑程序的屏幕录制教程视频。我们引入了一个名为 TutorialVQA 的数据集,由约 6000 个手动收集的视频、问题、答案区间三元组构成。我们还给出了若干基于视频转录文本的基线算法的实验结果。结果表明该任务具有挑战性,并呼吁研究新算法。

关键词

引用

@article{arxiv.1912.01046,
  title  = {TutorialVQA: Question Answering Dataset for Tutorial Videos},
  author = {Anthony Colas and Seokhwan Kim and Franck Dernoncourt and Siddhesh Gupte and Daisy Zhe Wang and Doo Soon Kim},
  journal= {arXiv preprint arXiv:1912.01046},
  year   = {2020}
}

备注

Accepted at LREC 2020