中文

MobileAIBench:面向移动设备的大语言模型与大 multimodal 模型基准测试

计算与语言 2024-06-18 v1 人工智能 机器学习

摘要

将大语言模型(LLM)和大 multimodal 模型(LMM)部署到移动设备上因提升隐私、稳定性和个性化等优势而受到广泛关注。然而,移动设备的硬件限制 necessitates 使用参数更少的模型和量化等模型压缩技术。目前,缺乏对量化对各种任务性能影响(包括 LLM 任务、LMM 任务以及关键的可信度与安全性)的充分了解。缺乏足够的工具用于在移动设备上系统性测试这些模型。为此,我们引入 MobileAIBench,一个用于评估移动优化 LLM 和 LMM 的全面基准框架。MobileAIBench 评估不同规模、量化水平和任务下的模型,测量在真实设备上的延迟和资源消耗。我们的两部分开源框架包括用于在桌面上运行评估的库和用于 on-device 延迟和硬件利用率测量的 iOS App。我们的深入分析旨在通过提供部署 LLM 和 LMM 在移动平台上性能和可行性见解,加速移动 AI 研究和部署。

关键词

引用

@article{arxiv.2406.10290,
  title  = {MobileAIBench: Benchmarking LLMs and LMMs for On-Device Use Cases},
  author = {Rithesh Murthy and Liangwei Yang and Juntao Tan and Tulika Manoj Awalgaonkar and Yilun Zhou and Shelby Heinecke and Sachin Desai and Jason Wu and Ran Xu and Sarah Tan and Jianguo Zhang and Zhiwei Liu and Shirley Kokane and Zuxin Liu and Ming Zhu and Huan Wang and Caiming Xiong and Silvio Savarese},
  journal= {arXiv preprint arXiv:2406.10290},
  year   = {2024}
}