只需提问:从数百万叙述视频中学习回答问题
计算机视觉与模式识别
2021-08-13 v3 计算与语言
机器学习
摘要
近期视觉问答方法依赖于大规模标注数据集。然而,为视频手动标注问题与答案繁琐、昂贵且阻碍可扩展性。本工作中,我们提出避免手动标注,并利用自动跨模态监督生成大规模视频问答训练数据集。我们借助在文本数据上训练的问题生成 transformer,并用其从转写的视频叙述中生成问答对。给定叙述视频,我们随后自动生成含有 6900 万视频-问题-答案三元组的 HowToVQA69M 数据集。为处理该数据集中多样答案的开放词表,我们提出了一种基于视频-问题多模态 transformer 与答案 transformer 之间对比损失的训练流程。我们引入了零样本 VideoQA 任务并展示了优异结果,尤其对于罕见答案。此外,我们证明我们的方法在 MSRVTT-QA、MSVD-QA、ActivityNet-QA 和 How2QA 上显著优于当前最优(SOTA)。最后,为详细评估我们引入了 iVQA,一个具有减弱语言偏置和高质量冗余人工标注的新 VideoQA 数据集。我们的代码、数据集与训练模型可在 https://antoyang.github.io/just-ask.html 获取。
引用
@article{arxiv.2012.00451,
title = {Just Ask: Learning to Answer Questions from Millions of Narrated Videos},
author = {Antoine Yang and Antoine Miech and Josef Sivic and Ivan Laptev and Cordelia Schmid},
journal= {arXiv preprint arXiv:2012.00451},
year = {2021}
}
备注
Accepted at ICCV 2021 (Oral); 20 pages; 14 figures