中文

H2OVL-Mississippi 视觉语言模型技术报告

计算机视觉与模式识别 2024-10-18 v1 人工智能 计算与语言 机器学习

摘要

较小的视觉语言模型 (VLM) 因其能够在消费级硬件上高效运行而日益重要,这对于处理企业商业文档和图像具有隐私保护意义。这些模型需要具备强大的语言理解和视觉能力,以增强人机交互。为此,我们提出 H2OVL-Mississippi,一对在 3700 万图像-文本对上训练的小型 VLM,使用 240 小时的计算资源(8 台 H100 GPU)。H2OVL-Mississippi-0.8B 是一个拥有 0.8 十亿参数的小型模型,专注于文本识别,在 OCRBench 文本识别部分实现了最先进的性能,甚至超越了 much larger 模型。此外,我们发布 H2OVL-Mississippi-2B,一个拥有 20 亿参数的模型,用于通用场景,表现出在 various 学术基准测试中的高度竞争的指标。这两款模型基于我们先前的 H2O-Danube 语言模型开发,扩展了其在视觉领域的能力。我们以 Apache 2.0 许可证发布这些模型,让 VLMs 向所有人开放, democratizing 文档 AI 和视觉 LLM。

关键词

引用

@article{arxiv.2410.13611,
  title  = {H2OVL-Mississippi Vision Language Models Technical Report},
  author = {Shaikat Galib and Shanshan Wang and Guanshuo Xu and Pascal Pfeiffer and Ryan Chesler and Mark Landry and Sri Satish Ambati},
  journal= {arXiv preprint arXiv:2410.13611},
  year   = {2024}
}