中文

一种用于视频-语言理解的 CLIP 增强方法

计算机视觉与模式识别 2021-10-15 v1 计算与语言

摘要

本技术报告总结了我们参与视频与语言理解评测(Video-And-Language Understanding Evaluation, VALUE)挑战赛(https://value-benchmark.github.io/challenge_2021.html)的方法。我们提出了一种 CLIP 增强方法,将图像-文本预训练知识引入下游视频-文本任务。结合其他若干改进设计,我们的方法在 VALUE 基准上以 2.4%2.4\%57.5857.5860.0060.00)的 Meta-Ave 分数超越了当前最优(state-of-the-art)方法。

关键词

引用

@article{arxiv.2110.07137,
  title  = {A CLIP-Enhanced Method for Video-Language Understanding},
  author = {Guohao Li and Feng He and Zhifan Feng},
  journal= {arXiv preprint arXiv:2110.07137},
  year   = {2021}
}

备注

3 pages, 1 figure, 2 tables. Technical report