中文

VisionGPT-3D:用于增强 3D 视觉理解的通用多模态智能体

计算机视觉与模式识别 2024-03-25 v2 人工智能 计算与语言 图形学

摘要

文本到视觉组件的演进正在促进人们的日常生活,例如从文本生成图像、视频以及识别图像中所需的元素。计算机视觉模型在前几天的多模态能力研究主要聚焦于基于明确定义的对象的图像检测和分类。大语言模型(LLM)引入了从自然语言到视觉对象的转换,这些对象为文本上下文呈现视觉布局。OpenAI GPT-4 作为 LLM 的巅峰,而计算机视觉(CV)领域拥有大量尖端(SOTA)模型和算法将 2D 图像转换为其 3D 表示。然而,算法与问题之间的不匹配可能导致不理想的结果。为应对这一挑战,我们提出了一个统一的 VisionGPT-3D 框架,以整合最先进的视觉模型,促进面向视觉的 AI 开发。VisionGPT-3D 提供了一个灵活的多模态框架,基于多模态基础模型的优势。它无缝集成各种 SOTA 视觉模型,实现了对 SOTA 视觉模型选择的自动化,识别与 2D 深度图分析相对应的合适 3D 网格创建算法,基于多样化的多模态输入(如文本提示)生成最佳结果。

关键词

引用

@article{arxiv.2403.09530,
  title  = {VisionGPT-3D: A Generalized Multimodal Agent for Enhanced 3D Vision Understanding},
  author = {Chris Kelly and Luhui Hu and Jiayin Hu and Yu Tian and Deshun Yang and Bang Yang and Cindy Yang and Zihao Li and Zaoshan Huang and Yuexian Zou},
  journal= {arXiv preprint arXiv:2403.09530},
  year   = {2024}
}

备注

12 pages, 7 figures, pending conference