一种用于视频-语言理解的 CLIP 增强方法
计算机视觉与模式识别
2021-10-15 v1 计算与语言
摘要
本技术报告总结了我们参与视频与语言理解评测(Video-And-Language Understanding Evaluation, VALUE)挑战赛(https://value-benchmark.github.io/challenge_2021.html)的方法。我们提出了一种 CLIP 增强方法,将图像-文本预训练知识引入下游视频-文本任务。结合其他若干改进设计,我们的方法在 VALUE 基准上以 ( 至 )的 Meta-Ave 分数超越了当前最优(state-of-the-art)方法。
引用
@article{arxiv.2110.07137,
title = {A CLIP-Enhanced Method for Video-Language Understanding},
author = {Guohao Li and Feng He and Zhifan Feng},
journal= {arXiv preprint arXiv:2110.07137},
year = {2021}
}
备注
3 pages, 1 figure, 2 tables. Technical report