VisionPangu:一个紧凑且细粒度的多模态助手(17 亿参数)
计算机视觉与模式识别
2026-03-06 v1 计算与语言
摘要
大型多模态模型 (LMM) 在视觉语言理解方面取得了强大的性能,但许多现有方法依赖大规模架构和粗糙监督,这限制了其生成详细图像描述的能力。本文提出 VisionPangu,一个紧凑的 17 亿参数多模态模型,旨在通过高效多模态对齐和高质量监督改进详细图像描述。我们的模型将 InternVL 派生的视觉编码器通过轻量级 MLP 投影器与 OpenPangu-Embedded 语言主干相结合,采用受 LLaVA 启发的指令调优管道。通过纳入来自 DOCCI 数据集的稠密人类编写描述,VisionPangu 在不依赖激进模型扩展的情况下提高了语义连贯性和描述丰富性。实验结果表明,紧凑型多模态模型能够实现具有竞争力的性能,同时生成更结构化和详细的描述。该代码和模型权重将在 https://www.modelscope.cn/models/asdfgh007/visionpangu 上公开。
引用
@article{arxiv.2603.04957,
title = {VisionPangu: A Compact and Fine-Grained Multimodal Assistant with 1.7B Parameters},
author = {Jiaxin Fan and Wenpo Song},
journal= {arXiv preprint arXiv:2603.04957},
year = {2026}
}