中文

面向多模态视频字幕的端到端生成式预训练

计算机视觉与模式识别 2022-05-11 v2 人工智能 计算与语言 人机交互

摘要

近期的视频与语言预训练框架缺乏生成句子的能力。我们提出多模态视频生成式预训练(MV-GPT),一种从未经标注的视频中学习的新型预训练框架,可有效用于多模态视频字幕等生成任务。与近期的视频-语言预训练框架不同,我们的框架联合训练一个多模态视频编码器和一个句子解码器。为克服无标注视频中字幕缺失的问题,我们利用未来的话语作为额外的文本来源,并提出一种双向生成目标——给定当前多模态上下文生成未来话语,以及给定未来观测生成当前话语。借助该目标,我们端到端地训练一个编码器-解码器模型,直接从原始像素和转写语音生成字幕。我们的模型在四个标准基准上的多模态视频字幕任务,以及 VideoQA、视频检索和动作分类等其他视频理解任务上均取得了最先进的性能。

关键词

引用

@article{arxiv.2201.08264,
  title  = {End-to-end Generative Pretraining for Multimodal Video Captioning},
  author = {Paul Hongsuck Seo and Arsha Nagrani and Anurag Arnab and Cordelia Schmid},
  journal= {arXiv preprint arXiv:2201.08264},
  year   = {2022}
}