中文

TeachCLIP:用于高效文本到视频检索的多粒度教学

计算机视觉与模式识别 2023-08-03 v1

摘要

对于旨在由临时文本查询检索未标注视频的文本到视频检索(T2VR),基于CLIP的方法占据主导。与高效紧凑的CLIP4Clip相比,最先进的模型倾向于通过细粒度跨模态特征交互与匹配来计算视频-文本相似度,使其对大规模T2VR的可扩展性受到质疑。为高效T2VR,我们提出TeachCLIP,采用多粒度教学让基于CLIP4Clip的学生网络从更先进但计算繁重的模型(如X-CLIP、TS2-Net和X-Pool)中学习。为提升学生的学习能力,我们添加了注意帧特征聚合(AFA)块,其设计在检索阶段不增加额外存储/计算开销。虽然AFA产生的注意权重通常用于组合帧级特征,我们提出一种权重的全新用法,使其模仿由教师网络估计的帧-文本相关性。由此,AFA为学生(教师)提供了一条细粒度学习(教学)通道。在多个公开数据集上的大量实验证明了所提方法的可行性。

关键词

引用

@article{arxiv.2308.01217,
  title  = {TeachCLIP: Multi-Grained Teaching for Efficient Text-to-Video Retrieval},
  author = {Kaibin Tian and Ruixiang Zhao and Hu Hu and Runquan Xie and Fengzong Lian and Zhanhui Kang and Xirong Li},
  journal= {arXiv preprint arXiv:2308.01217},
  year   = {2023}
}