中文

Prismatic VLM:探究视觉条件语言模型的设计空间

计算机视觉与模式识别 2024-05-31 v2 人工智能 计算与语言 机器学习

摘要

视觉条件语言模型(VLM)在视觉对话、场景理解和机器人任务规划等应用中日益普及;这种普及催生了 LLaVa、InstructBLIP 和 PaLI-3 等大量新模型。尽管新模型层出不穷,但围绕图像预处理、架构和优化等关键设计决策的研究仍显不足,使得难以理解哪些因素决定了模型性能——而缺乏客观、一致的评估进一步加剧了这一挑战。为解决这些差距,我们首先编译了一套标准化评估套件,涵盖视觉问答、物体定位以及探测幻觉等属性的挑战集;这些评估提供了对 VLM 能力的细粒度洞察。其次,我们严格调查了 VLM 沿关键设计轴的表现,包括预训练视觉表示、基于基座模型与指令微调语言模型的训练等。我们将分析与三项资源贡献相结合:(1) 一个用于评估 VLM 的统一框架,(2) 优化且灵活的训练代码,以及 (3) 所有模型的检查点,包括一个规模为 70 亿至 130 亿参数的 VLM 家族,其性能严格优于当前开放 VLM 中的最先进模型 InstructBLIP 和 LLaVa v1.5。

关键词

引用

@article{arxiv.2402.07865,
  title  = {Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models},
  author = {Siddharth Karamcheti and Suraj Nair and Ashwin Balakrishna and Percy Liang and Thomas Kollar and Dorsa Sadigh},
  journal= {arXiv preprint arXiv:2402.07865},
  year   = {2024}
}

备注

Published at ICML 2024. 22 pages, 11 figures. Training code and models: https://github.com/TRI-ML/prismatic-vlms. Evaluation code: https://github.com/TRI-ML/vlm-evaluation