中文

分析视觉-语言模型在视频理解任务上的零样本能力

计算机视觉与模式识别 2023-11-28 v2 人工智能 计算与语言

摘要

在大规模图像-文本对或视频-文本对或两者上预训练的基础多模态模型,在下游任务上展现出强大的泛化能力。然而与图像-文本模型不同,由于难以收集大规模干净且对齐的数据,以及预训练阶段涉及的指数级计算成本,预训练视频-文本模型往往不可行。因此,一个切要的问题是:图像-文本模型能否适配到视频任务,且相较于直接在视频上预训练,使用这些模型是否有益处?在本工作中,我们聚焦于该问题,通过对图像-文本模型在零样本设定下评估视频理解任务时的泛化能力进行详尽研究来探讨。我们在涵盖视频动作识别(video AR)、视频检索(video RT)、视频问答(video QA)、视频多选(video MC)和视频描述(video CP)的多样化视频任务上考察了9个基础图像-文本模型。我们的实验表明,图像-文本模型在video AR、video RT和video MC上表现优异,在视频描述上表现中等,在video QA上表现较差。这些发现揭示了适配基础图像-文本模型至一系列视频任务、同时避免昂贵预训练步骤的益处。

关键词

引用

@article{arxiv.2310.04914,
  title  = {Analyzing Zero-Shot Abilities of Vision-Language Models on Video Understanding Tasks},
  author = {Avinash Madasu and Anahita Bhiwandiwalla and Vasudev Lal},
  journal= {arXiv preprint arXiv:2310.04914},
  year   = {2023}
}