中文

利用自然语言监督学习视频嵌入空间

计算机视觉与模式识别 2023-04-11 v2

摘要

CLIP模型近期的成功展示了其在广泛视觉与语言任务中的应用潜力。然而,这仅建立了语言与图像之间的嵌入空间关系,而未涉及视频领域。本文提出一种将视频嵌入空间映射到自然语言的新方法。我们提出一种两阶段方法:首先使用预训练CNN从视频的每一帧提取视觉特征,然后利用CLIP模型对视频领域的视觉特征及相应文本描述进行编码。我们在两个基准数据集UCF101和HMDB51上评估了我们的方法,并在两项任务上均取得了最先进的性能。

关键词

引用

@article{arxiv.2303.14584,
  title  = {Learning video embedding space with Natural Language Supervision},
  author = {Phani Krishna Uppala and Abhishek Bamotra and Shriti Priya and Vaidehi Joshi},
  journal= {arXiv preprint arXiv:2303.14584},
  year   = {2023}
}