中文

FLAVA:基础语言与视觉对齐模型

计算机视觉与模式识别 2022-03-31 v3 计算与语言

摘要

SOTA 视觉及视觉-语言模型依赖于大规模视觉-语言预训练,以在各种下游任务中获得良好性能。通常,此类模型往往要么是跨模态(对比性)的,要么是多模态(早期融合)的,但不能兼顾;而且它们通常只针对特定的模态或任务。一个有前景的方向是使用单一的整体通用模型作为“基础”,同时针对所有模态——一个真正的视觉与语言基础模型应该擅长视觉任务、语言任务以及跨模态和多模态的视觉与语言任务。我们引入了 FLAVA 作为这样的模型,并在涵盖这些目标模态的广泛 35 项任务上展示了令人瞩目的性能。

关键词

引用

@article{arxiv.2112.04482,
  title  = {FLAVA: A Foundational Language And Vision Alignment Model},
  author = {Amanpreet Singh and Ronghang Hu and Vedanuj Goswami and Guillaume Couairon and Wojciech Galuba and Marcus Rohrbach and Douwe Kiela},
  journal= {arXiv preprint arXiv:2112.04482},
  year   = {2022}
}

备注

CVPR 2022