GSQ-调优:用于 LLMs 边缘设备微调的组共享指数整数全量化训练
机器学习
2025-05-30 v3 人工智能
计算与语言
摘要
大型语言模型(LLMs)微调技术取得了显著成果。然而,传统的 LLMs 微调方法面临诸多挑战:它们需要大量浮点运算(FP)计算,在处理敏感数据时引发隐私顾虑,且不实用于资源受限的边缘设备。虽然参数高效微调(PEFT)技术减少了可训练参数,但其对浮点算术的依赖导致与边缘硬件根本不兼容。本文引入一种用于边缘设备 LLMs 微调的新型框架,名为 GSQ-调优,该框架在推理和训练中完全消除浮点运算的需求。其核心是组共享指数整数格式(Group-Shared Exponents Integer format),该格式利用参数组间共享指数,以整数格式高效表示模型参数。结合类 LoRA 适配器,这一方法实现了完全基于整数的微调,既节省内存又降低计算开销。我们展示,所提方法在准确率上与基于 BF16 的微调相当,同时将内存使用降低 1.85 倍。此外,与 FP8 相比,本方法可将功耗降低 5 倍、芯片面积缩减 11 倍,且性能不变,使大规模模型适配在边缘设备上变得可行。
引用
@article{arxiv.2502.12913,
title = {GSQ-Tuning: Group-Shared Exponents Integer in Fully Quantized Training for LLMs On-Device Fine-tuning},
author = {Sifan Zhou and Shuo Wang and Zhihang Yuan and Mingjia Shi and Yuzhang Shang and Dawei Yang},
journal= {arXiv preprint arXiv:2502.12913},
year = {2025}
}
备注
Accepted by Findings of ACL 2025