中文

Cambrian-1:面向视觉的开放式多模态 LLM 探索

计算机视觉与模式识别 2024-12-05 v2

摘要

我们介绍 Cambrian-1,一套面向视觉的多模态 LLM(MLLM)。虽然更强大的语言模型可以增强多模态能力,但视觉组件的设计选择往往不足以探索且与视觉表征学习研究不够紧密。这一差距阻碍了在实际场景中实现准确的感官 grounding。我们的研究将 LLM 和视觉指令调谐作为评估各种视觉表征的界面,为不同模型和架构(自监督、强监督或其组合)提供新见解,这些见解基于与 20 多种视觉编码器的实验得出。我们批判性地审查了现有的 MLLM 基准,解决了在各种任务中整合和解释结果的困难,并引入了新的视觉中心基准 CV-Bench。为了进一步提高视觉 grounding,我们提出了空间视觉聚合器(SVA),这是一种动态且空间感知的连接器,将高分辨率视觉特征与 LLM 集成,同时减少标记数量。此外,我们讨论了如何从公开来源策划高质量的视觉指令调谋数据,强调数据来源平衡和分布比例的重要性。总体而言,Cambrian-1 不仅实现了最先进的性能,还作为一套全面、开放的指令调谋 MLLM 食谱。我们提供模型权重、代码、支持工具、数据集以及详细的指令调谋和评估配方。我们希望我们的发布将激发并加速多模态系统和视觉表征学习的进展。

关键词

引用

@article{arxiv.2406.16860,
  title  = {Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs},
  author = {Shengbang Tong and Ellis Brown and Penghao Wu and Sanghyun Woo and Manoj Middepogu and Sai Charitha Akula and Jihan Yang and Shusheng Yang and Adithya Iyer and Xichen Pan and Ziteng Wang and Rob Fergus and Yann LeCun and Saining Xie},
  journal= {arXiv preprint arXiv:2406.16860},
  year   = {2024}
}

备注

NeurIPS 2024 (Oral). Website at https://cambrian-mllm.github.io