中文

通过文本理解视频场景:基于文本的视觉问答洞察

计算机视觉与模式识别 2023-09-12 v2

摘要

研究者已广泛研究视觉与语言领域,发现视觉与文本内容对有效理解场景均至关重要。尤其,理解视频中的文本意义重大,需要场景文本理解与时序推理兼备。本文聚焦于探索两个近期引入的数据集NewsVideoQA和M4-ViteVQA,它们旨在解决基于文本内容的视频问答。NewsVideoQA数据集包含与新闻视频中文本相关的问答对,而M4-ViteVQA包含来自vlogging、旅行和购物等多样类别的问答对。我们在多个层面对这些数据集的构建方式进行分析,探究回答所需视觉理解与时序多帧理解的程度。此外,研究使用仅文本模型BERT-QA进行实验,其在两个数据集上均表现出与原始方法相当的性能和,表明这些数据集构建中的缺陷。进一步,我们还通过考察在M4-ViteVQA上训练并在NewsVideoQA上评估的反向域适应方面,从而阐明域外训练的挑战与潜在益处。

关键词

引用

@article{arxiv.2309.01380,
  title  = {Understanding Video Scenes through Text: Insights from Text-based Video Question Answering},
  author = {Soumya Jahagirdar and Minesh Mathew and Dimosthenis Karatzas and C. V. Jawahar},
  journal= {arXiv preprint arXiv:2309.01380},
  year   = {2023}
}