中文

重新审视基于 CLIP 的图像到视频知识迁移中的时序建模

计算机视觉与模式识别 2023-01-27 v1 人工智能

摘要

图像-文本预训练模型(如 CLIP)已从大规模图像-文本数据对中学习到令人印象深刻的通用多模态知识,从而因其改善视频领域视觉表征学习的潜力而受到越来越多的关注。本文中,基于 CLIP 模型,我们重新审视图像到视频知识迁移背景下的时序建模,这是将图像-文本预训练模型扩展到视频领域的关键点。我们发现,当前的时序建模机制要么专为高层语义主导任务(如检索)定制,要么专为底层视觉模式主导任务(如识别)定制,无法同时适用于两种情况。关键难点在于建模时间依赖性的同时利用 CLIP 模型中的高层与底层知识。为解决此问题,我们提出空间-时间辅助网络(STAN)——一种简单而有效的时序建模机制,将 CLIP 模型扩展到多样化视频任务。具体而言,为实现底层与高层知识迁移,STAN 采用具有分解的空间-时间模块的分支结构,使多级 CLIP 特征得以进行空间-时间上下文化。我们在两个代表性视频任务上评估了我们的方法:视频-文本检索与视频识别。大量实验证明了我们的模型在包括 MSR-VTT、DiDeMo、LSMDC、MSVD、Kinetics-400 和 Something-Something-V2 在内的多个数据集上优于最先进(SOTA)方法。代码将发布于 https://github.com/farewellthree/STAN

关键词

引用

@article{arxiv.2301.11116,
  title  = {Revisiting Temporal Modeling for CLIP-based Image-to-Video Knowledge Transferring},
  author = {Ruyang Liu and Jingjia Huang and Ge Li and Jiashi Feng and Xinglong Wu and Thomas H. Li},
  journal= {arXiv preprint arXiv:2301.11116},
  year   = {2023}
}