TVQA:局部化、组合式的视频问答
计算与语言
2019-05-09 v2 人工智能
计算机视觉与模式识别
摘要
近年来,基于图像的问答(QA)任务受到越来越多的关注。然而,由于数据限制,基于视频的QA研究要少得多。本文中,我们提出TVQA,一个基于6部热门电视剧的大规模视频QA数据集。TVQA包含来自21,793个片段的152,545个问答对,覆盖超过460小时视频。问题被设计为具有组合性,要求系统联合定位片段中的相关时刻、理解基于字幕的对话并识别相关视觉概念。我们提供了对这一新数据集的分析,以及若干基线和用于TVQA任务的多流端到端可训练神经网络框架。该数据集公开于 http://tvqa.cs.unc.edu。
引用
@article{arxiv.1809.01696,
title = {TVQA: Localized, Compositional Video Question Answering},
author = {Jie Lei and Licheng Yu and Mohit Bansal and Tamara L. Berg},
journal= {arXiv preprint arXiv:1809.01696},
year = {2019}
}
备注
EMNLP 2018 (13 pages; Data and Leaderboard at: http://tvqa.cs.unc.edu). Updated with test-public results