我们在MovieQA中提出了正确的问题吗?
计算机视觉与模式识别
2019-11-11 v1 计算与语言
摘要
视觉与语言联合任务(如视觉问答)因其探究高层理解而引人入胜,但与此同时,也更容易受到语言偏置的影响。本文探究MovieQA数据集中的偏置,并提出一个极其简单的可利用这些偏置的模型。我们发现使用恰当的词嵌入至关重要。通过使用适当训练的词嵌入,约一半的问答(QAs)仅通过查看问题与答案即可作答,完全忽略来自视频片段、字幕与电影剧本的叙述上下文。相较于排行榜上已发表的最佳论文,我们仅基于问题+答案的简单模型在视频+字幕类上准确率提升5%,字幕类提升5%,DVS类提升15%,剧本类提升6%。
引用
@article{arxiv.1911.03083,
title = {Are we asking the right questions in MovieQA?},
author = {Bhavan Jasani and Rohit Girdhar and Deva Ramanan},
journal= {arXiv preprint arXiv:1911.03083},
year = {2019}
}
备注
Spotlight presentation at CLVL workshop, ICCV 2019. Project page: https://bhavanj.github.io/MovieQAWithoutMovies/