中文

使用CLIP进行视频检索的简单框架

计算机视觉与模式识别 2021-03-01 v2

摘要

视频检索是一项具有挑战性的任务,其中文本查询与视频匹配,反之亦然。大多数现有方法依赖于用户提供的标注。虽然简单,但这种方法在实践中并不总是可行。在这项工作中,我们探索了语言-图像模型CLIP的应用,以在无需上述标注的情况下获得视频表示。该模型经过专门训练,学习了一个可以比较图像和文本的公共空间。利用本文描述的各种技术,我们将其应用扩展到视频,在MSR-VTT和MSVD基准上获得了最先进的结果。

关键词

引用

@article{arxiv.2102.12443,
  title  = {A Straightforward Framework For Video Retrieval Using CLIP},
  author = {Jesús Andrés Portillo-Quintero and José Carlos Ortiz-Bayliss and Hugo Terashima-Marín},
  journal= {arXiv preprint arXiv:2102.12443},
  year   = {2021}
}

备注

10 pages, 1 figure, submitted to Mexican Conference for Pattern Recognition (MCPR 2021); corrected results section and added model specifications