中文

数据代谢:面向视觉语言模型的高效数据设计模式

计算与语言 2025-04-18 v1 人工智能 计算机视觉与模式识别

摘要

数据策划在训练强大的视觉语言模型(VLMs)中起着至关重要的作用。在这项工作中,我们引入了数据代谢的概念,并提出了以数据为中心的框架,以在整个开发生命周期中构建VLMs。从标准的模型架构出发,我们讨论并深入探讨了两个关键的开发步骤:数据策划与迭代,形成了一个持续提升模型性能的闭环系统。我们展示了关于如何处理现有海量数据集并构建用户特定数据飞轮的详细代码手册。作为示范,我们发布了一个名为Capybara-VL的VLM,它在典型的多模态任务(如视觉问答、科学推理和富文本任务)中表现出色。尽管其规模相对紧凑,Capybara-VL超越了几个规模大至10倍的开源模型。此外,它取得了与数个领先专有模型相当的结果,展示了其卓越的竞争力。这些结果突显了我们以数据为中心的框架的强大力量,以及训练更小、更高效VLMs的潜力。

关键词

引用

@article{arxiv.2504.12316,
  title  = {Data Metabolism: An Efficient Data Design Schema For Vision Language Model},
  author = {Jingyuan Zhang and Hongzhi Zhang and Zhou Haonan and Chenxi Sun and Xingguang ji and Jiakang Wang and Fanheng Kong and Yahui Liu and Qi Wang and Fuzheng Zhang},
  journal= {arXiv preprint arXiv:2504.12316},
  year   = {2025}
}

备注

To be presented at ICLR 2025, First Workshop on Open Science for Foundation Models