中文

AndesVL技术报告:高效移动端多模态大语言模型

计算机视觉与模式识别 2025-12-23 v3 人工智能

摘要

近年来,尽管云端 MLLM 如 QwenVL、InternVL、GPT-4o、Gemini 和 Claude Sonnet 已在模型规模达到数千亿参数后展现出卓越的性能,但它们在内存、功耗和计算容量方面显著超出了诸如手机等边缘设备的限制。本文介绍了AndesVL,这是一套基于Qwen3 LLM和各种视觉编码器,参数规模为0.6B至4B的移动端 MLLM。我们全面概述了AndesVL的模型架构、训练管道和训练数据的构成,表明其在广泛的开源基准测试中实现了一线水平性能,涵盖文本丰富图像理解、推理与数学、多图像理解、通用VQA、幻觉缓解、多语言理解和GUI相关任务,与规模相似的SOTA模型相比表现优异。此外,我们引入了1+N LoRA 架构,以及一种量化感知 LoRA 微调(QALFT)框架,以促进AndesVL在移动端部署时的高效任务适应和模型压缩。进一步地,利用我们提出的缓存驱逐算法OKV,以及定制的推测解码和压缩策略,我们实现了在MediaTek Dimensity 9500芯片上部署AndesVL-4B时,峰值解码加速度比达6.7倍,内存降低最高可达30.9%,权重压缩至1.8比特。我们将发布所有模型至 https://huggingface.co/OPPOer。

引用

@article{arxiv.2510.11496,
  title  = {AndesVL Technical Report: An Efficient Mobile-side Multimodal Large Language Model},
  author = {Zhiwei Jin and Xiaohui Song and Nan Wang and Yafei Liu and Chao Li and Xin Li and Ruichen Wang and Zhihao Li and Qi Qi and Long Cheng and Dongze Hao and Quanlong Zheng and Yanhao Zhang and Haobo Ji and Jian Ma and Zhitong Zheng and Zhenyi Lin and Haolin Deng and Xin Zou and Xiaojie Yin and Ruilin Wang and Liankai Cai and Haijing Liu and Yuqing Qiu and Ke Chen and Zixian Li and Chi Xie and Huafei Li and Chenxing Li and Chuangchuang Wang and Kai Tang and Zhiguang Zhu and Kai Tang and Wenmei Gao and Rui Wang and Jun Wu and Chao Liu and Qin Xie and Chen Chen and Haonan Lu},
  journal= {arXiv preprint arXiv:2510.11496},
  year   = {2025}
}

备注

Tech report of OPPO AndesVL Team