中文

使用 CLIP 引导的视觉-文本注意力进行视频问答

计算机视觉与模式识别 2023-03-09 v2 人工智能 多媒体

摘要

视频与文本的跨模态学习在视频问答(VideoQA)中起着关键作用。本文中,我们提出一种视觉-文本注意力机制,以利用在大量通用领域语言-图像对上训练的对比语言-图像预训练(CLIP)来引导 VideoQA 的跨模态学习。具体而言,我们首先使用 TimeSformer 从目标应用领域提取视频特征,使用 BERT 提取文本特征,并利用 CLIP 通过领域特定学习从通用知识领域提取一对视觉-文本特征。然后我们提出跨领域学习以提取目标领域与通用领域之间视觉与语言特征的注意力信息。这组 CLIP 引导的视觉-文本特征被整合以预测答案。所提方法在 MSVD-QA 和 MSRVTT-QA 数据集上进行了评估,并优于最先进的方法。

关键词

引用

@article{arxiv.2303.03131,
  title  = {Video Question Answering Using CLIP-Guided Visual-Text Attention},
  author = {Shuhong Ye and Weikai Kong and Chenglin Yao and Jianfeng Ren and Xudong Jiang},
  journal= {arXiv preprint arXiv:2303.03131},
  year   = {2023}
}

备注

Submitted to the 2023 IEEE International Conference on Image Processing (ICIP 2023)