中文

OmniVL:一个面向图像-语言与视频-语言任务的统一基础模型

计算机视觉与模式识别 2022-10-21 v2

摘要

本文提出 OmniVL,一种采用统一架构同时支持图像-语言与视频-语言任务的新基础模型。它采用一个基于 transformer 的统一视觉编码器处理图像与视频输入,因此能够执行联合的图像-语言与视频-语言预训练。我们首次证明,这样一种范式对图像与视频任务均有裨益,而非传统的单向迁移(例如用图像-语言来帮助视频-语言)。为此,我们提出一种解耦的联合图像-语言与视频-语言预训练,将视觉-语言建模有效分解为空间与时间维度,并在图像与视频任务上均获得性能提升。此外,我们引入一种新颖的统一视觉-语言对比(UniVLC)损失,以联合利用图像-文本、视频-文本、图像-标签(如图像分类)、视频-标签(如视频动作识别)数据,从而尽可能利用有监督与含噪监督的预训练数据。在不引入额外任务特定适配器的情况下,OmniVL 可同时支持纯视觉任务(如图像分类、视频动作识别)、跨模态对齐任务(如图像/视频-文本检索)以及多模态理解与生成任务(如图像/视频问答、描述生成)。我们在广泛下游任务上评估 OmniVL,并在相似模型规模与数据规模下取得最先进或具竞争力的结果。

关键词

引用

@article{arxiv.2209.07526,
  title  = {OmniVL:One Foundation Model for Image-Language and Video-Language Tasks},
  author = {Junke Wang and Dongdong Chen and Zuxuan Wu and Chong Luo and Luowei Zhou and Yucheng Zhao and Yujia Xie and Ce Liu and Yu-Gang Jiang and Lu Yuan},
  journal= {arXiv preprint arXiv:2209.07526},
  year   = {2022}
}

备注

To appear at NeurIPs 2022, Camera Ready with Typos fixed