中文

从图像字幕学习文本到视频检索

计算机视觉与模式识别 2024-04-29 v1

摘要

我们描述了一种使用未标记视频进行文本到视频检索训练的协议,其中我们假设(i)无法访问任何视频的标签,即无法访问真实字幕集,但(ii)可以访问以文本形式标记的图像。使用图像专家模型是一个现实的场景,因为标注图像更便宜且可扩展,而视频标注方案昂贵。最近,零样本图像专家如CLIP为视频理解任务建立了新的强基线。在本文中,我们利用这一进展,从两种类型的模型实例化图像专家:文本到图像检索模型提供初始骨干,图像字幕模型为未标记视频提供监督信号。我们表明,使用图像字幕自动标记视频帧可以实现文本到视频检索训练。该过程以零手动标注成本将特征适应目标域,从而优于强零样本CLIP基线。在训练期间,我们从多个视频帧中采样与视觉内容最匹配的字幕,并通过根据每个字幕对帧的相关性进行评分,对帧表示进行时间池化。我们进行了广泛的消融实验以提供见解,并通过在三个标准数据集(ActivityNet、MSR-VTT和MSVD)上优于CLIP零样本基线,证明了这一简单框架的有效性。

关键词

引用

@article{arxiv.2404.17498,
  title  = {Learning text-to-video retrieval from image captioning},
  author = {Lucas Ventura and Cordelia Schmid and Gül Varol},
  journal= {arXiv preprint arXiv:2404.17498},
  year   = {2024}
}

备注

A short version of this work appeared at CVPR 2023 Workshops. Project page: https://imagine.enpc.fr/~ventural/multicaps/