中文

更大更有价值?无线边缘网络中高效大型 AI 模型推理

机器学习 2025-05-15 v1

摘要

大规模人工智能模型 (LAIM) 服务日益增长的需求正在推动从传统的云基推理向边缘推理范式转变,以满足低延迟和隐私保护应用的需求。特别是,边缘设备联合推理,这种将 LAIM 在边缘设备和服务器之间进行分区的策略,正在成为资源受限环境下高效 LAIM 执行的有前景的策略。在本文中,我们研究一种面向剪枝的 LAIM 联合推理方案,即对预训练的 LAIM 进行剪枝处理,并将其划分为用于部署的设备端和服务器端子模型。为进行分析,首先我们证明了 LAIM 输出失真上界由其参数失真所决定。随后,基于率失真理论推导了参数失真的下界,严格刻画了剪枝比例与联合推理性能之间的关系。基于上述分析结果,本文构建了 LAIM 联合推理失真下界最小化问题,联合优化剪枝比例、传输功率和计算频率,在系统延迟、能耗和可用资源约束下进行求解。此外,本文提出了一种高效算法来解决上述高度非凸问题。最后,通过大量仿真实验表明本文设计的有效性。特别是,模型参数失真被证明可靠地界定了输出失真。此外,所提出的剪枝比例和资源管理联合设计在与基准方案(如完全设备端和服务器端推理)相比,能够在推理性能、系统延迟和能耗之间的权衡方面取得优异性能。此外,分割点被证明在异构和资源受限的边缘环境下对系统性能优化起关键作用。

关键词

引用

@article{arxiv.2505.09214,
  title  = {The Larger the Merrier? Efficient Large AI Model Inference in Wireless Edge Networks},
  author = {Zhonghao Lyu and Ming Xiao and Jie Xu and Mikael Skoglund and Marco Di Renzo},
  journal= {arXiv preprint arXiv:2505.09214},
  year   = {2025}
}