中文

面向前沿视觉语言模型的后训练数据策略

计算机视觉与模式识别 2025-01-28 v1 人工智能 机器学习

摘要

最近,开源视觉语言模型(VLM)在使其能力接近专有前沿模型方面取得了显著进展。然而,大多数开源模型仅发布其最终模型权重,使关键数据策略和实现细节几乎不可见。在本 work中,我们从数据中心的角度来探讨VLM后训练,表明数据策略在开发前沿VLM中发挥关键作用。通过从头构建我们的后训练数据策略,我们分享了开发过程中的详细见解,旨在为开源社区的竞争模型开发提供帮助。我们引入的数据策略,以及训练配方和模型设计,导致一系列高性能VLMs的命名为Eagle2。具体而言,Eagle2-9B在各种多模态基准测试中实现了最先进的结果,匹配了最具竞争力的模型,参数规模可达70B。

关键词

引用

@article{arxiv.2501.14818,
  title  = {Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models},
  author = {Zhiqi Li and Guo Chen and Shilong Liu and Shihao Wang and Vibashan VS and Yishen Ji and Shiyi Lan and Hao Zhang and Yilin Zhao and Subhashree Radhakrishnan and Nadine Chang and Karan Sapra and Amala Sanjay Deshmukh and Tuomas Rintamaki and Matthieu Le and Ilia Karmanov and Lukas Voegtle and Philipp Fischer and De-An Huang and Timo Roman and Tong Lu and Jose M. Alvarez and Bryan Catanzaro and Jan Kautz and Andrew Tao and Guilin Liu and Zhiding Yu},
  journal= {arXiv preprint arXiv:2501.14818},
  year   = {2025}
}