CLIP2TV:用于视频文本检索的对齐、匹配与蒸馏
计算机视觉与模式识别
2022-07-22 v2 计算与语言
摘要
现代视频文本检索框架基本由三部分组成:视频编码器、文本编码器与相似度头。随着视觉与文本表示学习的成功,基于 transformer 的编码器与融合方法也被采用于视频文本检索领域。在本报告中,我们提出 CLIP2TV,旨在探究基于 transformer 的方法中关键要素之所在。为此,我们首先回顾多模态学习的一些近期工作,随后将若干技术引入视频文本检索,最后通过不同配置下的大量实验对它们进行评估。值得注意的是,CLIP2TV 在 MSR-VTT 数据集上取得 52.9@R1,以 4.1% 的优势超越先前 SOTA 结果。
引用
@article{arxiv.2111.05610,
title = {CLIP2TV: Align, Match and Distill for Video-Text Retrieval},
author = {Zijian Gao and Jingyu Liu and Weiqi Sun and Sheng Chen and Dedan Chang and Lili Zhao},
journal= {arXiv preprint arXiv:2111.05610},
year = {2022}
}