jina-vlm:小型多语言视觉语言模型
计算与语言
2026-05-05 v3 人工智能
计算机视觉与模式识别
摘要
我们提出 jina-vlm,这是一个 token 效率高的 24 亿参数视觉语言模型,在开源 20 亿参数 VLMs 中实现了最先进的多语言 VQA 性能。该模型将 SigLIP2 视觉编码器与 Qwen3 语言解码器结合,并利用图像分块和注意力池化进行任意分辨率图像的 token 高效处理。为了理解不同训练数据类别的贡献,我们进行了逐一删除数据混合物消融研究——系统性地删除任务、域、模式和语言类别——以诊断哪些数据类型是必要的而不是冗余的,以及任务效益是否跨域传递。模型权重和代码已公开发布于 https://huggingface.co/jinaai/jina-vlm。
引用
@article{arxiv.2512.04032,
title = {jina-vlm: Small Multilingual Vision Language Model},
author = {Andreas Koukounas and Georgios Mastrapas and Florian Hönicke and Sedigheh Eslami and Guillaume Roncari and Scott Martens and Han Xiao},
journal= {arXiv preprint arXiv:2512.04032},
year = {2026}
}
备注
23 pages, 1-10 main content, 11-23 references and appendix