中文

SmolVLM:重新定义小型且高效的多模态模型

人工智能 2025-04-08 v1 计算机视觉与模式识别

摘要

大型视觉语言模型(Vision-Language Models, VLMs)提供卓越的性能,但需要大量计算资源,限制了其在移动和边缘设备上的部署。较小的 VLMs 通常仿照大型模型的设计选择,如大量图像标记,导致 GPU 内存使用效率低下,难以实现实际的设备应用。我们提出 SmolVLM,一系列为资源高效推理而设计的紧凑型多模态模型。我们系统性地探索了针对低计算开销优化的架构配置、标记策略和数据策划。通过这种方式,我们识别出在最小内存占用下实现显著性能提升的关键设计选择。我们最小的模型 SmolVLM-256M 在推理时使用的 GPU 内存不足 1GB,便能超越规模为 30 亿倍的 Idefics-80B 模型,尽管开发时间相隔 18 个月。我们最大的模型规模为 22 亿参数,性能与 SOTA VLMs 持平,却仅使用两倍的 GPU 内存。SmolVLM 模型不仅支持静态图像,还展现出强大的视频理解能力。我们的实验结果强调,战略性的架构优化、激进而高效的标记策略,以及精心策划的训练数据,显著提升了多模态性能,促进了在大幅度缩小的规模下实现实际、高效能的部署。

关键词

引用

@article{arxiv.2504.05299,
  title  = {SmolVLM: Redefining small and efficient multimodal models},
  author = {Andrés Marafioti and Orr Zohar and Miquel Farré and Merve Noyan and Elie Bakouch and Pedro Cuenca and Cyril Zakka and Loubna Ben Allal and Anton Lozhkov and Nouamane Tazi and Vaibhav Srivastav and Joshua Lochner and Hugo Larcher and Mathieu Morlon and Lewis Tunstall and Leandro von Werra and Thomas Wolf},
  journal= {arXiv preprint arXiv:2504.05299},
  year   = {2025}
}