中文

基于百万视频蒸馏视觉-语言模型

计算机视觉与模式识别 2024-04-17 v2

摘要

视觉-语言模型的最新进展很大程度上归功于丰富的图像-文本数据。我们旨在为视频-语言模型复制这一成功,但现有的人工标注视频-文本数据远远不足。因此,我们转而利用合成的指令数据,从一个强大的图像-语言基线模型微调视频-语言模型。由此产生的视频指令微调(VIIT)视频模型随后被用于自动标注数百万视频,以生成高质量的字幕。我们展示了经过适配的视频-语言模型在广泛的视频-语言基准测试中表现良好。例如,它在开放式 NExT-QA 上比之前的最佳结果高出 2.8%。此外,我们的模型为之前未见过的视频生成详细描述,提供了比现有方法更好的文本监督。实验表明,在这些自动生成的字幕上进行对比训练的视频-语言双编码器模型,比同样利用视觉-语言模型的最强基线模型高出 3.8%。我们的最佳模型在 MSR-VTT 零样本文本到视频检索上,比最先进的方法高出 6%。作为副产品,我们生成了迄今为止最大的视频字幕数据集。

关键词

引用

@article{arxiv.2401.06129,
  title  = {Distilling Vision-Language Models on Millions of Videos},
  author = {Yue Zhao and Long Zhao and Xingyi Zhou and Jialin Wu and Chun-Te Chu and Hui Miao and Florian Schroff and Hartwig Adam and Ting Liu and Boqing Gong and Philipp Krähenbühl and Liangzhe Yuan},
  journal= {arXiv preprint arXiv:2401.06129},
  year   = {2024}
}

备注

CVPR 2024. Project page: https://zhaoyue-zephyrus.github.io/video-instruction-tuning