视觉-语言预训练模型综述
计算机视觉与模式识别
2022-07-19 v2 计算与语言
机器学习
摘要
随着 transformer 的发展,预训练模型近年来以极快的速度取得进展。它们已主导自然语言处理(NLP)和计算机视觉(CV)中的主流技术。如何使预训练适应视觉与语言(V-L)学习领域并提升下游任务性能,成为多模态学习的焦点。在本文中,我们综述了视觉-语言预训练模型(VL-PTMs)的最新进展。作为核心内容,我们首先简要介绍在预训练之前将原始图像和文本编码为单模态嵌入的几种方法。然后,我们深入探讨 VL-PTMs 在建模文本与图像表示之间交互的主流架构。我们进一步给出广泛使用的预训练任务,并介绍一些常见的下游任务。最后我们总结本文并给出一些有前景的研究方向。本综述旨在为研究人员提供综合梳理及相关研究指引。
引用
@article{arxiv.2202.10936,
title = {A Survey of Vision-Language Pre-Trained Models},
author = {Yifan Du and Zikang Liu and Junyi Li and Wayne Xin Zhao},
journal= {arXiv preprint arXiv:2202.10936},
year = {2022}
}
备注
Accepted by IJCAI-2022 survey track