NExT-QA:从问答到解释时序动作的视频理解下一阶段
计算机视觉与模式识别
2021-05-25 v2 人工智能
摘要
我们提出了 NExT-QA,一个经过严谨设计的视频问答(VideoQA)基准,旨在将视频理解从描述时序动作推进到解释时序动作。基于该数据集,我们设立了针对因果动作推理、时序动作推理和常见场景理解的多项选择与开放式问答任务。通过对基线和已有 VideoQA 技术的广泛分析,我们发现表现最优的方法擅长浅层场景描述,但在因果与时序动作推理上较弱。此外,在多项选择问答上有效的模型,当迁移到开放式问答时,仍难以泛化答案。这引发了对这些模型推理能力的质疑,并凸显了改进空间。借助针对不同问题类型的详细结果以及对未来工作的启发性观察,我们希望 NExT-QA 能引导下一代 VQA 研究超越表层场景描述,迈向对视频更深层次的理解。(数据集及相关资源见 https://github.com/doc-doc/NExT-QA.git)
引用
@article{arxiv.2105.08276,
title = {NExT-QA:Next Phase of Question-Answering to Explaining Temporal Actions},
author = {Junbin Xiao and Xindi Shang and Angela Yao and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2105.08276},
year = {2021}
}
备注
To appear at CVPR2021.(Receive one 'Strong Accept'. Review comments: The benchmark will be beneficial for an important video understanding problem. The analysis is comprehensive and provides meaningful insights.)