中文

VideoOFA:用于视频到文本生成的两阶段预训练

计算机视觉与模式识别 2023-05-08 v1 计算与语言

摘要

我们提出了一种用于视频到文本生成任务(如视频字幕与视频问答)的新两阶段预训练框架:一个生成式编码器-解码器模型首先在海量的图像-文本数据上联合预训练以学习基础视觉-语言概念,随后在中间视频-文本预训练阶段适配到视频数据,以学习时空推理等视频专属技能。因此,我们的 VideoOFA 模型在四个视频字幕基准上取得了新的最先进性能,以 CIDEr 分数平均超越先前方法 9.7 分。它还在两个开放式视频问答数据集上优于现有模型,展现出其作为通用视频到文本模型的泛化能力。

关键词

引用

@article{arxiv.2305.03204,
  title  = {VideoOFA: Two-Stage Pre-Training for Video-to-Text Generation},
  author = {Xilun Chen and Lili Yu and Wenhan Xiong and Barlas Oğuz and Yashar Mehdad and Wen-tau Yih},
  journal= {arXiv preprint arXiv:2305.03204},
  year   = {2023}
}