中文

ActivityNet-QA:用于通过问答理解复杂网络视频的数据集

计算机视觉与模式识别 2019-06-07 v1

摘要

近年来,语言与视觉建模方面的发展已成功应用于图像问答。将这一研究方向扩展到视频领域以进行视频问答(VideoQA)既关键又自然。与存在大规模且完全标注基准数据集的图像领域相比,VideoQA 数据集局限于小规模且为自动生成等。这些限制制约了它们在实际中的适用性。在此我们提出 ActivityNet-QA,一个完全标注且大规模的 VideoQA 数据集。该数据集包含基于流行的 ActivityNet 数据集衍生的 5,800 个复杂网络视频上的 58,000 个问答对。我们对 ActivityNet-QA 数据集进行了统计分析,并通过比较现有 VideoQA 基线方法在其上开展了大量实验。此外,我们探索了多种视频表示策略以提升 VideoQA 性能,尤其是针对长视频。该数据集可在 https://github.com/MILVLG/activitynet-qa 获取。

关键词

引用

@article{arxiv.1906.02467,
  title  = {ActivityNet-QA: A Dataset for Understanding Complex Web Videos via Question Answering},
  author = {Zhou Yu and Dejing Xu and Jun Yu and Ting Yu and Zhou Zhao and Yueting Zhuang and Dacheng Tao},
  journal= {arXiv preprint arXiv:1906.02467},
  year   = {2019}
}

备注

Accepted at AAAI 2019