Prismatic VLM:探究视觉条件语言模型的设计空间
计算机视觉与模式识别
2024-05-31 v2 人工智能
计算与语言
机器学习
摘要
视觉条件语言模型(VLM)在视觉对话、场景理解和机器人任务规划等应用中日益普及;这种普及催生了 LLaVa、InstructBLIP 和 PaLI-3 等大量新模型。尽管新模型层出不穷,但围绕图像预处理、架构和优化等关键设计决策的研究仍显不足,使得难以理解哪些因素决定了模型性能——而缺乏客观、一致的评估进一步加剧了这一挑战。为解决这些差距,我们首先编译了一套标准化评估套件,涵盖视觉问答、物体定位以及探测幻觉等属性的挑战集;这些评估提供了对 VLM 能力的细粒度洞察。其次,我们严格调查了 VLM 沿关键设计轴的表现,包括预训练视觉表示、基于基座模型与指令微调语言模型的训练等。我们将分析与三项资源贡献相结合:(1) 一个用于评估 VLM 的统一框架,(2) 优化且灵活的训练代码,以及 (3) 所有模型的检查点,包括一个规模为 70 亿至 130 亿参数的 VLM 家族,其性能严格优于当前开放 VLM 中的最先进模型 InstructBLIP 和 LLaVa v1.5。
引用
@article{arxiv.2402.07865,
title = {Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models},
author = {Siddharth Karamcheti and Suraj Nair and Ashwin Balakrishna and Percy Liang and Thomas Kollar and Dorsa Sadigh},
journal= {arXiv preprint arXiv:2402.07865},
year = {2024}
}
备注
Published at ICML 2024. 22 pages, 11 figures. Training code and models: https://github.com/TRI-ML/prismatic-vlms. Evaluation code: https://github.com/TRI-ML/vlm-evaluation