Griffon-G:通过大多模态模型桥接视觉语言与视觉中心任务
计算机视觉与模式识别
2024-10-22 v1
摘要
大型多模态模型(LMMs)在基于自回归建模方面取得了显著进展,已在各种视觉语言和视觉中心任务中取得突破。然而,这些模型通常只关注要么视觉中心任务(如视觉 grounding 和区域描述),要么视觉语言任务(如图像描述和多场景 VQA)。目前尚无LMM能够像自然语言处理领域的大型语言模型那样,综合地在单个模型中实现两类任务。即便拥有丰富的多任务指令数据,直观地将这些数据堆叠用于通用能力扩展也面临挑战。为此,我们引入一种新颖的多维度精选和整合的多模态数据集,命名为 CCMD-8M,通过多层次数据精选和多任务整合,克服了统一视觉中心与视觉语言任务数据障碍。更重要的是,我们提出 Griffon-G,一个通用大型多模态模型,能够在单个端到端范式中处理视觉中心和视觉语言任务。Griffon-G 解决了在联合优化这类任务时训练崩溃的问题,实现了更好的训练效率。跨越多模态基准、通用视觉问答(VQA)任务、场景文本中心 VQA 任务、文档相关 VQA 任务、指代表达理解和目标检测等评估显示,Griffon-G 超越了先进的 LMM, 在复杂的视觉中心任务中实现了专家水平的性能。
引用
@article{arxiv.2410.16163,
title = {Griffon-G: Bridging Vision-Language and Vision-Centric Tasks via Large Multimodal Models},
author = {Yufei Zhan and Hongyin Zhao and Yousong Zhu and Fan Yang and Ming Tang and Jinqiao Wang},
journal= {arXiv preprint arXiv:2410.16163},
year = {2024}
}
备注
This work has been submitted to the IEEE for possible publication. Codes and data will be later released at https://github.com/jefferyZhan/Griffon