DramaQA:基于分层问答的以角色为中心的视频故事理解
计算与语言
2020-12-18 v2 人工智能
计算机视觉与模式识别
摘要
尽管计算机视觉与自然语言处理近期取得了进展,但由于视频故事固有的难度,研发能够理解视频故事的机器仍难以实现。此外,关于如何基于人类认知过程评估视频理解程度的研究尚未取得进展。本文提出一种新颖的视频问答(Video QA)任务 DramaQA,用于视频故事的综合理解。DramaQA 聚焦于两个视角:1)基于人类智能认知发展阶段的分层问答作为评估指标;2)以角色为中心的视频标注以建模故事的局部连贯性。我们的数据集构建于电视剧《Another Miss Oh》,包含来自 23,928 个不同时长视频片段的 17,983 个问答对,每个问答对属于四个难度级别之一。我们提供 217,308 张带有丰富以角色为中心标注的图像,包括视觉边界框、主要角色的行为与情绪,以及共指消解后的剧本。此外,我们提出多级上下文匹配模型,该模型分层理解视频的以角色为中心的表示以回答问题。我们公开发布数据集与模型以供研究,并期望我们的工作为视频故事理解研究提供新视角。
引用
@article{arxiv.2005.03356,
title = {DramaQA: Character-Centered Video Story Understanding with Hierarchical QA},
author = {Seongho Choi and Kyoung-Woon On and Yu-Jung Heo and Ahjeong Seo and Youwon Jang and Minsu Lee and Byoung-Tak Zhang},
journal= {arXiv preprint arXiv:2005.03356},
year = {2020}
}
备注
15 pages, 11 figures, accepted to AAAI 2021