大型多模态模型:CVPR 2023 教程纪要
计算机视觉与模式识别
2023-06-27 v1
摘要
本教程纪要总结了 CVPR 2023 关于“视觉基础模型的最新进展”教程中“大型多模态模型:构建并超越多模态 GPT-4”部分的报告内容。该教程由三部分组成。我们首先介绍近期类 GPT 的视觉-语言建模大型模型的背景,以引出指令微调大型多模态模型(LMMs)的研究动机。作为前置知识,我们阐述大型语言模型中指令微调的基础,并进一步将其扩展到多模态空间。最后,我们展示如何利用开源资源构建类多模态 GPT-4 模型的最小原型,并回顾近期涌现的相关主题。
引用
@article{arxiv.2306.14895,
title = {Large Multimodal Models: Notes on CVPR 2023 Tutorial},
author = {Chunyuan Li},
journal= {arXiv preprint arXiv:2306.14895},
year = {2023}
}
备注
27 pages, 24 figures; Tutorial website: https://vlp-tutorial.github.io/