移动设备上视觉语言模型的高效部署:基于 OnePlus 13R 的案例研究
机器学习
2025-07-15 v2
摘要
视觉语言模型 (Vision-Language Models, VLM) 为移动设备提供了前景的功能,但由于计算限制和能源效率低下,尤其是针对实时应用,其部署面临重大挑战。本研究提供了一套全面的移动设备上 VLM 部署框架综述,评估了 llama.cpp、MLC-Imp 和 mllm 在 OnePlus 13R 上运行 LLaVA-1.5 7B、MobileVLM-3B 和 Imp-v1.5 3B 作为代表性工作负载的情形。每个部署框架在 OnePlus 13R 上运行 VLM 时都进行了评估,测量包括 CPU、GPU 和 NPU 利用率、温度、推理时间、功耗以及用户体验。基准测试揭示了框架之间存在的关键性能瓶颈:在 token 生成期间,CPU 资源 consistently 过度利用,而 GPU 和 NPU 加速器被很少使用。当 GPU 被用于图像特征提取时,由于其被饱和,导致设备响应性下降。该研究贡献了框架级别的基准、实用分析工具以及对硬件利用瓶颈的深入分析,突出了当前部署框架中 CPU 过度使用的一致性,以及 GPU 和 NPU 的无效或不稳定使用的情形。
引用
@article{arxiv.2507.08505,
title = {Efficient Deployment of Vision-Language Models on Mobile Devices: A Case Study on OnePlus 13R},
author = {Pablo Robin Guerrero and Yueyang Pan and Sanidhya Kashyap},
journal= {arXiv preprint arXiv:2507.08505},
year = {2025}
}