中文

CLIP 遇见视频字幕生成:概念感知表示学习至关重要

计算机视觉与模式识别 2022-08-23 v2

摘要

对于视频字幕生成,“预训练后微调”已成为事实上的范式,其中通常使用 ImageNet 预训练(INP)对视频内容进行编码,随后从零开始微调面向任务的网络以应对字幕生成。本文首次研究了近期提出的 CLIP(对比语言-图像预训练)对视频字幕生成的影响。通过对 INP 与 CLIP 的实证研究,我们指出了 INP 的潜在缺陷并探讨了准确描述生成的关键因素。结果表明,基于 INP 的模型难以捕捉概念语义且对无关背景信息敏感;相比之下,基于 CLIP 的模型显著提升了字幕质量,并凸显了概念感知表示学习的重要性。基于这些发现,我们提出双重概念检测(DCD)以在训练中将概念知识进一步注入模型。DCD 是一项辅助任务,要求字幕模型学习视频内容与概念之间的对应以及概念间的共现关系。在 MSR-VTT 与 VATEX 上的实验证明了 DCD 的有效性,可视化结果进一步揭示了学习概念感知表示的必要性。

关键词

引用

@article{arxiv.2111.15162,
  title  = {CLIP Meets Video Captioning: Concept-Aware Representation Learning Does Matter},
  author = {Bang Yang and Tong Zhang and Yuexian Zou},
  journal= {arXiv preprint arXiv:2111.15162},
  year   = {2022}
}

备注

to appear in the 5th Chinese Conference on Pattern Recognition and Computer Vision (PRCV 2022)