FALQON:基于低位浮点算术加速 LoRA 微调
机器学习
2025-10-29 v1 人工智能
摘要
低位浮点格式(如FP8)由于在现代GPU和NPU上的原生硬件支持,能够在模型训练中实现显著加速和内存节省。然而,我们分析发现FP8量化主要为大维度矩阵乘法提供加速,而对低秩适应(LoRA)施加的固有量化开销会削弱LoRA用于高效微调大型语言模型(LLM)的小维度矩阵的加速效果。为此,我们提出FALQON,一种新型框架,通过直接将LoRA适配器合并到FP8量化主干网络中进行微调,以消除LoRA计算路径的量化开销。进一步,我们重新构建合并适配器的前向和反向计算,以显著降低量化开销,引入行级代理更新机制,高效地将大量更新整合到量化主干中。实验评估表明,FALQON在保持类似精度水平的同时,相对于现有量化LoRA方法实现约3倍的训练加速,为大规模模型高效微调提供了实用解决方案。此外,FALQON的端到端FP8工作流程无需后训练量化,便于高效部署。代码已公开于https://github.com/iamkanghyunchoi/falqon。
引用
@article{arxiv.2510.24061,
title = {FALQON: Accelerating LoRA Fine-tuning with Low-Bit Floating-Point Arithmetic},
author = {Kanghyun Choi and Hyeyoon Lee and SunJong Park and Dain Kwon and Jinho Lee},
journal= {arXiv preprint arXiv:2510.24061},
year = {2025}
}
备注
NeurIPS 2025