NEWSKVQA:基于知识感知的新闻视频问答
计算机视觉与模式识别
2022-02-09 v1 多媒体
摘要
在视频语境下回答问题有助于视频索引、视频检索系统、视频摘要、学习管理系统和监控视频分析。尽管视觉问答已有大量工作,但视频问答的工作(1)局限于电影、电视节目、游戏或人类活动等域,且(2)大多基于常识推理。本文探索视频问答的新前沿:在新闻视频语境下回答基于知识的问题。为此,我们策划了一个包含 12K 新闻视频的新数据集,时长跨越 156 小时,具有 1M 多项选择题-答案对,涵盖 8263 个唯一实体。我们公开了该数据集。利用此数据集,我们提出一种新方法 NEWSKVQA(Knowledge-Aware News Video Question Answering,基于知识感知的新闻视频问答),其对文本多项选择题、视频、其转录文本和知识库进行多模态推理,并给出了一个强基线。
引用
@article{arxiv.2202.04015,
title = {NEWSKVQA: Knowledge-Aware News Video Question Answering},
author = {Pranay Gupta and Manish Gupta},
journal= {arXiv preprint arXiv:2202.04015},
year = {2022}
}