中文

CLIP4Caption:用于视频字幕生成的 CLIP 框架

计算机视觉与模式识别 2021-10-14 v1

摘要

视频字幕生成是一项具有挑战性的任务,因为它需要生成描述各种多样且复杂视频的句子。现有的视频字幕模型由于忽视了视频与文本之间存在的鸿沟而缺乏充分的视觉表征。为弥合这一鸿沟,本文提出一种 CLIP4Caption 框架,该框架基于 CLIP 增强的视频-文本匹配网络(VTM)来改进视频字幕生成。该框架充分利用视觉与语言两方面的信息,并强制模型学习强文本相关的视频特征以用于文本生成。此外,不同于大多数使用 LSTM 或 GRU 作为句子解码器的现有模型,我们采用 Transformer 结构的解码器网络来有效学习长程视觉与语言依赖。另外,我们引入了一种用于字幕任务的新颖集成策略。实验结果表明了我们的方法在两个数据集上的有效性:1)在 MSR-VTT 数据集上,我们的方法以 CIDEr 上高达 10% 的显著提升取得了新的 SOTA 结果;2)在私有测试数据上,我们的方法在 ACM MM 多媒体大挑战 2021:视频理解预训练挑战赛中排名第二。需注意,我们的模型仅在 MSR-VTT 数据集上训练。

关键词

引用

@article{arxiv.2110.06615,
  title  = {CLIP4Caption: CLIP for Video Caption},
  author = {Mingkang Tang and Zhanyu Wang and Zhenhua Liu and Fengyun Rao and Dian Li and Xiu Li},
  journal= {arXiv preprint arXiv:2110.06615},
  year   = {2021}
}