边缘端大型语言模型的微调与部署:问题与方法
人工智能
2025-08-07 v3
摘要
自 2019 年 GPT2-1.5B 发布以来,大型语言模型(LLMs)已从专用深度模型演变为通用基础模型。尽管展示了显著的零样本能力,但 LLMs 仍需要在本地数据集上进行微调,并在网络边缘部署时占用大量内存。传统的基于一阶的微调技术需要大量 GPU 内存,超出了主流硬件的容量。此外,LLMs 已从文本生成扩展到创建图像、音频、视频和多模态内容,这需要对大规模基础模型的高效部署策略进行仔细研究。为应对这些挑战,模型微调和模型压缩技术已被开发出来,以通过降低运营支出和资本支出来支持 LLMs 的可持续增长。在这项工作中,我们对网络边缘部署的内存高效微调方法进行了全面概述。我们还综述了模型压缩领域的最新文献,为网络边缘部署 LLMs 提供了见解。
引用
@article{arxiv.2408.10691,
title = {Fine-Tuning and Deploying Large Language Models Over Edges: Issues and Approaches},
author = {Yanjie Dong and Haijun Zhang and Chengming Li and Song Guo and Victor C. M. Leung and Xiping Hu},
journal= {arXiv preprint arXiv:2408.10691},
year = {2025}
}