大规模多模态预训练模型:全面综述
计算机视觉与模式识别
2024-04-11 v3 人工智能
多媒体
摘要
随着对通用深度模型的迫切需求,许多预训练大模型被提出,如 BERT、ViT、GPT 等。受这些模型在单一领域(如计算机视觉与自然语言处理)成功的启发,多模态预训练大模型近年来也吸引了越来越多关注。本文对这些模型进行全面综述,希望能为新研究者提供新见解并助其追踪最前沿工作。具体而言,我们首先通过回顾传统深度学习以及自然语言处理、计算机视觉与语音中的预训练工作来介绍多模态预训练的背景。随后,我们介绍多模态预训练模型(MM-PTMs)的任务定义、关键挑战与优势,并围绕数据、目标、网络架构与知识增强预训练讨论 MM-PTMs。之后,我们介绍用于验证大规模 MM-PTMs 的下游任务,包括生成、分类与回归任务。我们还给出代表性下游任务上模型参数与结果的可视化及分析。最后,我们指出该主题可能有益于未来工作的研究方向。此外,我们维护了一份持续更新的大规模预训练多模态大模型论文列表:https://github.com/wangxiao5791509/MultiModal_BigModels_Survey。本文已由期刊 Machine Intelligence Research (MIR) 发表,https://link.springer.com/article/10.1007/s11633-022-1410-8,DOI: 10.1007/s11633-022-1410-8,卷 20,期 4,页 447-482,2023。
引用
@article{arxiv.2302.10035,
title = {Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey},
author = {Xiao Wang and Guangyao Chen and Guangwu Qian and Pengcheng Gao and Xiao-Yong Wei and Yaowei Wang and Yonghong Tian and Wen Gao},
journal= {arXiv preprint arXiv:2302.10035},
year = {2024}
}
备注
Accepted by Machine Intelligence Research (MIR)