FLAVA:基础语言与视觉对齐模型
计算机视觉与模式识别
2022-03-31 v3 计算与语言
摘要
SOTA 视觉及视觉-语言模型依赖于大规模视觉-语言预训练,以在各种下游任务中获得良好性能。通常,此类模型往往要么是跨模态(对比性)的,要么是多模态(早期融合)的,但不能兼顾;而且它们通常只针对特定的模态或任务。一个有前景的方向是使用单一的整体通用模型作为“基础”,同时针对所有模态——一个真正的视觉与语言基础模型应该擅长视觉任务、语言任务以及跨模态和多模态的视觉与语言任务。我们引入了 FLAVA 作为这样的模型,并在涵盖这些目标模态的广泛 35 项任务上展示了令人瞩目的性能。
引用
@article{arxiv.2112.04482,
title = {FLAVA: A Foundational Language And Vision Alignment Model},
author = {Amanpreet Singh and Ronghang Hu and Vedanuj Goswami and Guillaume Couairon and Wojciech Galuba and Marcus Rohrbach and Douwe Kiela},
journal= {arXiv preprint arXiv:2112.04482},
year = {2022}
}
备注
CVPR 2022