中文

利用大规模视频转录推进高分辨率视频-语言表征

计算机视觉与模式识别 2022-07-11 v2

摘要

我们研究联合视频与语言(VL)预训练,以实现跨模态学习并惠及大量下游VL任务。现有工作要么提取低质量视频特征,要么学习受限的文本嵌入,同时忽视了高分辨率视频和多样化语义能够显著改善跨模态学习。本文中,我们提出一种新颖的高分辨率与多样化视频-语言预训练模型(HD-VILA),用于多种视觉任务。具体而言,我们收集了一个具有两个显著特性的大规模数据集:1)首个包含371.5k小时720p视频的高分辨率数据集,以及2)涵盖15个流行YouTube类别的最多样化数据集。为实现VL预训练,我们通过一个学习丰富时空特征的混合Transformer和一个强制所学视频特征与多样化文本交互的多模态Transformer来联合优化HD-VILA模型。我们的预训练模型在10个VL理解任务和2个更新的文本到视觉生成任务上取得了新的最先进结果。例如,在零样本MSR-VTT文本到视频检索任务中,我们以相对提升40.4%的R@1优于SOTA模型,在高分辨率数据集LSMDC中相对提升55.4%。所学的VL嵌入在文本到视觉编辑和超分辨率任务中也能有效生成视觉上令人愉悦且语义相关的成果。

关键词

引用

@article{arxiv.2111.10337,
  title  = {Advancing High-Resolution Video-Language Representation with Large-Scale Video Transcriptions},
  author = {Hongwei Xue and Tiankai Hang and Yanhong Zeng and Yuchong Sun and Bei Liu and Huan Yang and Jianlong Fu and Baining Guo},
  journal= {arXiv preprint arXiv:2111.10337},
  year   = {2022}
}