中文

基于大型多模态模型的弱监督高斯对比定位用于视频问答

计算机视觉与模式识别 2024-07-24 v4 人工智能 计算与语言

摘要

视频问答(VideoQA)旨在根据视频中观察到的信息回答自然语言问题。尽管大型多模态模型(LMMs)在图像-语言理解与推理方面近期取得了成功,但它们处理 VideoQA 的能力不足,仅将均匀采样的帧作为视觉输入,忽略了与问题相关的视觉线索。此外,现有的 VideoQA 数据集中没有针对问题关键时间戳的人工标注。鉴于此,我们提出了一种新颖的弱监督框架,强制 LMMs 以问题关键时刻作为视觉输入推理出答案。具体而言,我们首先利用 CLIP 模型的视觉-语言对齐能力,将问题和答案对融合为事件描述,以找到多个关键帧作为目标时刻和伪标签。以这些伪标记的关键帧作为额外的弱监督,我们设计了一个轻量级的基于高斯的对比定位(GCG)模块。GCG 学习多个高斯函数来表征视频的时间结构,并采样问题关键帧作为正样本时刻,作为 LMMs 的视觉输入。在多个基准上的大量实验验证了我们框架的有效性,且与先前的 SOTA 方法相比取得了显著提升。

关键词

引用

@article{arxiv.2401.10711,
  title  = {Weakly Supervised Gaussian Contrastive Grounding with Large Multimodal Models for Video Question Answering},
  author = {Haibo Wang and Chenghang Lai and Yixuan Sun and Weifeng Ge},
  journal= {arXiv preprint arXiv:2401.10711},
  year   = {2024}
}

备注

accepted by ACM Multimedia 2024