MagicVL-2B:通过课程学习实现轻量级视觉编码器的移动设备视觉语言模型
计算机视觉与模式识别
2025-08-05 v1 人工智能
摘要
视觉语言模型(VLM)在最近几年取得了显著的突破,使其能够在日常生活中实现多样化的应用。然而,VLM的巨大计算和存储需求对于在今天最普及和可接入的计算平台——移动设备上高效部署提出了重大挑战。本文介绍了MagicVL-2B,这是一个为旗舰智能手机精心优化的新型VLM。MagicVL-2B利用参数不足1亿的轻量级视觉编码器,并采用重新设计的动态分辨率方案,适应性地生成图像标记,无需对图像尺寸进行过度修改。为进一步提升此紧凑型编码器在VLM中的性能,我们提出了一种多模态课程学习策略,通过逐步增加任务难度和数据信息密度来增强训练。该方法在多种子任务上显著提高了模型性能。对MagicVL-2B在标准VLM基准测试的广泛评估表明,MagicVL-2B在准确率上与当前最先进的模型相匹配,同时将设备端功耗降低了41.1%。这些结果将MagicVL-2B确立为面向实际移动视觉语言应用的实用且稳健的解决方案,使其能够在智能手机上直接运行先进的多模态智能。
引用
@article{arxiv.2508.01540,
title = {MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning},
author = {Yi Liu and Xiao Xu and Zeyu Xu and Meng Zhang and Yibo Li and Haoyu Chen and Junkang Zhang and Qiang Wang and Jifa Sun and Siling Lin and Shengxun Cheng and Lingshu Zhang and Kang Wang},
journal= {arXiv preprint arXiv:2508.01540},
year = {2025}
}