使用资源高效剪枝从LLM中推导编码特定子模型
机器学习
2025-01-10 v1 人工智能
软件工程
摘要
大型语言模型(Large Language Model, LLM)在各种复杂代码生成任务中展现出卓越性能。然而,其更广泛的采用受限于显著的计算需求和高资源要求,尤其是内存和处理器资源。为缓解此类需求,采用模型剪枝技术以创建更紧凑的模型,参数显著减少。然而,现有方法未专注于高效提取编程语言特定的子模型。本文探索了通过非结构化剪枝(即Wanda)高效推导编码特定子模型的想法。我们检验了不同领域特定校准数据集对剪枝结果的影响,涵盖三个不同领域,并扩展分析至提取四个语言特定子模型:Python、Java、C++和JavaScript。我们是首次利用适当校准数据集高效提取编程语言特定子模型,同时保持对完整模型的可接受准确率。我们也是首次提供分析证据表明,特定领域任务激活了LLM中的不同区域,从而支持通过非结构化剪枝创建专业化子模型。我们认为本工作具有显著潜力,旨在通过降低计算需求,使LLM在消费级硬件上实现本地执行,从而支持对实时开发反馈至关重要的更快推理时间。
引用
@article{arxiv.2501.05248,
title = {Deriving Coding-Specific Sub-Models from LLMs using Resource-Efficient Pruning},
author = {Laura Puccioni and Alireza Farshin and Mariano Scazzariello and Changjie Wang and Marco Chiesa and Dejan Kostic},
journal= {arXiv preprint arXiv:2501.05248},
year = {2025}
}