基于冻结双向语言模型的零样本视频问答
计算机视觉与模式识别
2022-10-11 v2 计算与语言
机器学习
摘要
视频问答(VideoQA)是一项复杂任务,需要多样的多模态数据进行训练。然而,为视频人工标注问答对繁琐且阻碍可扩展性。为解决此问题,近期方法考虑无视觉问答人工标注的零样本设定。特别地,一种有前景的方法将仅在 Web 规模纯文本上预训练的冻结自回归语言模型适配到多模态输入。相比之下,我们此处基于冻结双向语言模型(BiLM)构建,并表明该方法为零样本 VideoQA 提供了更强且更廉价的替代方案。具体而言,(i) 我们使用轻量可训练模块将视觉输入与冻结 BiLM 结合,(ii) 我们使用 Web 爬取的多模态数据训练此类模块,最后 (iii) 我们通过掩码语言建模执行零样本 VideoQA 推理,其中被掩码文本是给定问题的答案。我们提出的方法 FrozenBiLM 在包括 LSMDC-FiB、iVQA、MSRVTT-QA、MSVD-QA、ActivityNet-QA、TGIF-FrameQA、How2QA 和 TVQA 在内的多种数据集上以显著优势超越零样本 VideoQA 的最优水平。它在少样本与全监督设定下也展现出有竞争力的性能。我们的代码与模型公开于 https://github.com/antoyang/FrozenBiLM。
引用
@article{arxiv.2206.08155,
title = {Zero-Shot Video Question Answering via Frozen Bidirectional Language Models},
author = {Antoine Yang and Antoine Miech and Josef Sivic and Ivan Laptev and Cordelia Schmid},
journal= {arXiv preprint arXiv:2206.08155},
year = {2022}
}
备注
NeurIPS 2022 Camera-Ready; Project Webpage: https://antoyang.github.io/frozenbilm.html; 25 pages; 5 figures