中文

边缘端大型语言模型的微调与部署:问题与方法

人工智能 2025-08-07 v3

摘要

自 2019 年 GPT2-1.5B 发布以来,大型语言模型(LLMs)已从专用深度模型演变为通用基础模型。尽管展示了显著的零样本能力,但 LLMs 仍需要在本地数据集上进行微调,并在网络边缘部署时占用大量内存。传统的基于一阶的微调技术需要大量 GPU 内存,超出了主流硬件的容量。此外,LLMs 已从文本生成扩展到创建图像、音频、视频和多模态内容,这需要对大规模基础模型的高效部署策略进行仔细研究。为应对这些挑战,模型微调和模型压缩技术已被开发出来,以通过降低运营支出和资本支出来支持 LLMs 的可持续增长。在这项工作中,我们对网络边缘部署的内存高效微调方法进行了全面概述。我们还综述了模型压缩领域的最新文献,为网络边缘部署 LLMs 提供了见解。

关键词

引用

@article{arxiv.2408.10691,
  title  = {Fine-Tuning and Deploying Large Language Models Over Edges: Issues and Approaches},
  author = {Yanjie Dong and Haijun Zhang and Chengming Li and Song Guo and Victor C. M. Leung and Xiping Hu},
  journal= {arXiv preprint arXiv:2408.10691},
  year   = {2025}
}