Penguin-VL:探索基于 LLM 的视觉编码器在视觉语言模型中的效率极限
摘要
视觉语言模型(VLM)的开发主要依赖扩大模型规模,这会阻碍在计算受限的移动和边缘设备(如智能手机和机器人)上的部署。本文探讨紧凑型(例如 2B 和 8B)VLMs的性能极限。我们挑战了当前流行的做法,即领先的VLMs必须依赖通过大规模对比预训练(例如 CLIP/SigLIP)初始化的视觉编码器。我们识别到了目标之间的不匹配:对比学习优化的是判别性,强制实现粗糙和类别级别的不变性,这抑制了密集描述和复杂VLM推理所需的细粒度视觉线索。为解决此问题,我们提出了Penguin-VL,其视觉编码器是从文本-only LLM初始化的。我们的实验表明,Penguin-Encoder 是传统对比预训练的优越替代方案,能够为多模态理解实现更高的视觉保真度和数据效率。 在各种图像和视频基准测试中,Penguin-VL 在数学推理方面的性能与领先VLMs(例如 Qwen3-VL)相当,并在文档理解、视觉知识和多视角视频理解等任务中超越了它们。值得注意的是,这些收益是通过轻量级架构实现的,表明更好的视觉表征而非模型规模扩大是性能提升的主要驱动力。我们的消融实验显示,Penguin-Encoder 在保持细粒度空间和时间线索方面始终优于对比预训练编码器,这些线索对密集感知和复杂推理至关重要。这使得它成为计算效率VLMs的强力即插即用替代方案,并在资源受限的环境中实现高性能。代码:https://github.com/tencent-ailab/Penguin-VL
引用
@article{arxiv.2603.06569,
title = {Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders},
author = {Boqiang Zhang and Lei Ke and Ruihan Yang and Qi Gao and Tianyuan Qu and Rossell Chen and Dong Yu and Leoweiliang},
journal= {arXiv preprint arXiv:2603.06569},
year = {2026}
}
备注
Penguin-VL demonstrates that text-only initialized vision encoders can achieve superior performance in multimodal understanding tasks; Code: https://github.com/tencent-ailab/Penguin-VL