VideoCoCa:基于对比描述器零样本迁移的视频-文本建模
计算机视觉与模式识别
2023-03-17 v3 机器学习
多媒体
摘要
我们探索一种高效建立基础视频-文本模型的方法。提出 VideoCoCa,其最大化复用预训练的图像-文本对比描述器(CoCa)模型,并以极少的额外训练将其适配到视频-文本任务。先前工作采用各类跨帧融合模块来适配图像-文本模型,而我们发现 CoCa 中的生成式注意力池化与对比式注意力池化层可即时适配展平的帧嵌入,在零样本视频分类与零样本文本到视频检索上取得最优结果。此外,我们在 VideoCoCa 之上探索轻量微调,在视频问答与视频描述任务上获得强劲表现。
引用
@article{arxiv.2212.04979,
title = {VideoCoCa: Video-Text Modeling with Zero-Shot Transfer from Contrastive Captioners},
author = {Shen Yan and Tao Zhu and Zirui Wang and Yuan Cao and Mi Zhang and Soham Ghosh and Yonghui Wu and Jiahui Yu},
journal= {arXiv preprint arXiv:2212.04979},
year = {2023}
}
备注
Tech report. arXiv v3: update text