UnifiedVisionGPT:通过通用多模态框架简化视觉导向 AI
计算机视觉与模式识别
2023-11-20 v1
摘要
在当前人工智能领域,基础模型是语言和视觉领域进步的基石。OpenAI GPT-4 已成为大语言模型 (LLM) 的巅峰,而计算机视觉 (CV) 领域拥有众多最先进 (SOTA) 模型,如 Meta 的 SAM 和 DINO,以及 YOLOS。然而,从头训练新模型所需的资金和计算负担仍是进步的重大障碍。为应对这一挑战,我们提出 UnifiedVisionGPT,一种旨在整合并自动化集成 SOTA 视觉模型的新框架,从而促进视觉导向 AI 的发展。UnifiedVisionGPT 通过四个关键特性脱颖而出:(1) 提供可适应广泛应用的多功能多模态框架,建立在多模态基础模型优势之上;(2) 无缝集成各类 SOTA 视觉模型以创建综合多模态平台,充分利用各模型的最佳组件;(3) 优先发展视觉导向 AI,确保 CV 领域比当前 LLM 发展轨迹更快速的进展;(4) 引入 SOTA 视觉模型选择的自动化,基于文本提示和图像等多样多模态输入生成最优结果。本文概述了 UnifiedVisionGPT 的架构与能力,展示了其通过增强的效率、通用性、泛化性和性能革新计算机视觉领域的潜力。我们的实现以及统一多模态框架和综合数据集已在 https://github.com/LHBuilder/SA-Segment-Anything 公开提供。
引用
@article{arxiv.2311.10125,
title = {UnifiedVisionGPT: Streamlining Vision-Oriented AI through Generalized Multimodal Framework},
author = {Chris Kelly and Luhui Hu and Cindy Yang and Yu Tian and Deshun Yang and Bang Yang and Zaoshan Huang and Zihao Li and Yuexian Zou},
journal= {arXiv preprint arXiv:2311.10125},
year = {2023}
}
备注
9 pages, 29 figures