我们到了吗?移动设备上LLM应用的效率测量研究
性能
2025-04-02 v1 人工智能
人机交互
网络与互联网体系结构
摘要
大型语言模型的最新进展促使人们产生了在移动设备上部署这些模型的兴趣,以实现无需依赖云连接的新型应用。然而,在资源有限的设备上部署LLM的效率限制带来了重大挑战。在本文中,我们开展了一项全面的测量研究,以评估移动端、边缘端和云端部署LLM应用之间的效率权衡。我们实现了AutoLife-Lite,这是一个简化的基于LLM的应用,通过分析智能手机传感器数据来推断用户位置和活动上下文。我们的实验表明:(1) 只有小型LLM(<4B参数)能在强大的移动设备上成功运行,尽管与较大模型相比存在质量限制;(2) 模型压缩能有效降低硬件要求,但可能导致显著的性能下降;(3) 在移动设备上运行LLM以产生有意义输出的延迟显著(>30秒),而云服务展现出更好的时间效率(<10秒);(4) 边缘部署在延迟和模型能力之间提供了折中方案,在基于CPU和基于GPU的设置下结果不同。这些发现为系统设计者提供了关于设备端LLM应用当前局限性和未来方向的有价值见解。
引用
@article{arxiv.2504.00002,
title = {Are We There Yet? A Measurement Study of Efficiency for LLM Applications on Mobile Devices},
author = {Xiao Yan and Yi Ding},
journal= {arXiv preprint arXiv:2504.00002},
year = {2025}
}