用于视频定位与问答的自链式图像-语言模型
计算机视觉与模式识别
2023-12-01 v2 人工智能
计算与语言
机器学习
摘要
近期研究表明,利用大型预训练图像-语言模型进行视频问答取得了有前景的结果。虽然这些图像-语言模型可以有效引导视频-语言模型的表示学习,但它们通常将均匀采样的视频帧拼接作为视觉输入,而缺乏显式的语言感知时间建模。当仅有部分视频输入与语言查询相关时,这种均匀帧采样常常导致遗漏重要的视觉线索。尽管人类通常会找到值得关注的视频片段并回放该片段以回答问题,但训练查询感知的视频时刻定位器往往需要昂贵的标注和高计算成本。为解决此问题,我们提出自链式视频定位-回答(SeViLA),一种利用单一图像-语言模型(BLIP-2)来处理视频时间关键帧定位与问答的新框架。SeViLA框架由两个模块组成:定位器(Localizer)与回答器(Answerer),二者均从BLIP-2进行参数高效微调。我们提出以两种方式链式连接这些模块以实现级联推理与自精炼。首先,在前向链中,定位器在视频中找到多个语言感知关键帧,回答器利用这些关键帧预测答案。其次,在反向链中,回答器生成关键帧伪标签以精炼定位器,从而缓解对昂贵视频时刻定位标注的需求。我们的SeViLA框架在5个具有挑战性的视频问答与事件预测基准上优于若干强基线,并在微调(NExT-QA、STAR)和零样本(NExT-QA、STAR、How2QA、VLEP)设定下均达到最先进水平(SOTA)。我们还分析了定位器的影响、定位器与其他时间定位模型的比较、定位器的预训练/自精炼,以及关键帧数量的变化。
引用
@article{arxiv.2305.06988,
title = {Self-Chained Image-Language Model for Video Localization and Question Answering},
author = {Shoubin Yu and Jaemin Cho and Prateek Yadav and Mohit Bansal},
journal= {arXiv preprint arXiv:2305.06988},
year = {2023}
}
备注
NeurIPS 2023; Our code and checkpoints are available at: https://github.com/Yui010206/SeViLA