大语言模型遇见计算机视觉:简要综述
计算机视觉与模式识别
2023-11-29 v1 人工智能
摘要
近来,大语言模型(LLM)与计算机视觉(CV)的交叉已成为一个关键的研究领域,推动了人工智能(AI)领域的重大进展。由于 transformer 已成为自然语言处理(NLP)和 CV 中许多最先进模型的骨干,理解其演进与潜在增强至关重要。本综述论文深入探讨 transformer 及其后续模型在该领域的最新进展,强调其革新视觉 transformer(ViT)与 LLM 的潜力。本综述还呈现了一项对比分析,将若干领先的商业与开源 LLM 的性能指标并列比较,阐明其优势与待改进之处,并文献综述了 LLM 如何被用于应对视觉相关任务。此外,综述全面收集了用于训练 LLM 的数据集,为在各种预训练与下游任务中取得高性能所提供的多样数据提供见解。综述以强调该领域的开放方向作结,提出未来研究与开发的潜在路径。本综述旨在凸显 LLM 对 CV 的深刻交叉,引领集成化与先进 AI 模型的新时代。
引用
@article{arxiv.2311.16673,
title = {Large Language Models Meet Computer Vision: A Brief Survey},
author = {Raby Hamadi},
journal= {arXiv preprint arXiv:2311.16673},
year = {2023}
}