视频问答:数据集、算法与挑战
计算机视觉与模式识别
2022-11-03 v2
摘要
视频问答(VideoQA)旨在根据给定的视频回答自然语言问题。随着近期视觉与语言联合理解的研究趋势,它获得了越来越多的关注。然而,与图像问答相比,视频问答在很大程度上未被充分探索且进展缓慢。尽管不同的算法不断被提出并在不同的 VideoQA 数据集上显示出成功,我们发现缺乏一个有意义的综述对其加以归类,这严重阻碍了其进展。本文因此对 VideoQA 提供了清晰的分类体系与全面分析,聚焦于数据集、算法和独特挑战。我们随后指出从事实型问答走向推理型问答以认知视频内容的研究趋势。最后,我们总结了一些未来探索的有前景方向。
引用
@article{arxiv.2203.01225,
title = {Video Question Answering: Datasets, Algorithms and Challenges},
author = {Yaoyao Zhong and Junbin Xiao and Wei Ji and Yicong Li and Weihong Deng and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2203.01225},
year = {2022}
}
备注
Accepted by EMNLP 2022