ZAYA1-VL-8B 技术报告
计算机视觉与模式识别
2026-05-12 v1 人工智能
摘要
我们提出 ZAYA1-VL-8B,一个基于我们内部语言模型 ZAYA1-8B 构建的紧凑型专家混合视觉语言模型。尽管规模紧凑,ZAYA1-VL 在多个图像理解、推理和计数基准上,表现与 Molmo2-4B 和 InternVL3.5-4B 等领先基础模型竞争,同时超越 Qwen2.5-VL-3B、PLM-3B 和 MolmoE-1B 等模型。该架构包含两个关键创新:(1) 集成到 LLM 中的视觉特定 LoRA 适配器,以不增加专家数量的方式增加模态特定容量;(2) LLM 中对图像标记的双向注意力,以增强视觉理解。我们详细描述了完整的训练管道,包括各阶段的数据组成、序列打包以及注意力掩码方案。该模型总计 92 亿参数,其中 14 亿活跃参数包括视觉编码器,且已在 https://huggingface.co/Zyphra/ZAYA1-VL 上公开可用。
引用
@article{arxiv.2605.08560,
title = {ZAYA1-VL-8B Technical Report},
author = {Hassan Shapourian and Kasra Hejazi and Olabode M. Sule and Beren Millidge},
journal= {arXiv preprint arXiv:2605.08560},
year = {2026}
}
备注
20 pages, 7 figures, 3 appendices (with 31 figures)