zFLoRA:零延迟融合低秩适配器
计算与语言
2025-10-31 v1 人工智能
机器学习
摘要
大型语言模型 (LLM) 越来越多地采用针对多个下游应用的任务特定适配器进行部署。在这种情况下,虽然这些看似微不足道的适配器参数(通常占基础模型的 less than 1%)数量虽少,但在推理阶段却产生了相当大的额外计算开销(最多比基础模型慢 2.5 倍)。本文提出一种新的零延迟融合低秩适配器 (zFLoRA),在基础模型之上引入零或可忽略的延迟开销。在 1B、3B 和 7B 大小的 LLM 上实验结果显示,zFLoRA 在包括低秩适配器 (LoRA) 以及全参数微调 (FFT) 等流行的监督微调基准测试中均表现优异。实验在 18 个不同任务上进行,涵盖常识推理、数学推理和摘要-对话三个类别。在 NPU (Samsung Galaxy S25+) 以及 GPU (NVIDIA H100) 平台上的延迟测量显示,所提出的 zFLoRA 适配器引入了零到可忽略的延迟开销。
引用
@article{arxiv.2510.25784,
title = {zFLoRA: Zero-Latency Fused Low-Rank Adapters},
author = {Dhananjaya Gowda and Seoha Song and Harshith Goka and Junhyun Lee},
journal= {arXiv preprint arXiv:2510.25784},
year = {2025}
}