中文

LoRA-Switch:通过系统-算法联合设计提升动态LLM适配器的效率

人工智能 2024-05-29 v1

摘要

近期的文献发现,定制或进一步改进大型语言模型(LLM)的有效方法是添加动态适配器,如带有Mixture-of-Experts (MoE) 结构的低秩适配器(LoRA)。尽管这些动态适配器计算复杂度适中,但却导致巨大的推理延迟开销,将解码速度减慢2.5倍以上。本文分析了动态适配器的细粒度成本,发现分碎的CUDA内核调用是根本原因。因此,我们提出了LoRA-Switch,一种用于高效动态适配器的系统-算法联合设计架构。不同于大多数现有动态结构采用层级或块级动态路由,LoRA-Switch引入了基于token的路由机制。它为每个token切换LoRA适配器和权重,并将其合并到主干网络中进行推理。为提高效率,这种切换通过优化的CUDA内核实现,该内核一次性融合所有LoRA适配器的合并操作。基于在常见基准测试上的实验,我们的方法在保持与现有动态适配器类似的准确率提升的同时,将解码延迟降低了超过2.4倍。

关键词

引用

@article{arxiv.2405.17741,
  title  = {LoRA-Switch: Boosting the Efficiency of Dynamic LLM Adapters via System-Algorithm Co-design},
  author = {Rui Kong and Qiyang Li and Xinyu Fang and Qingtian Feng and Qingfeng He and Yazhu Dong and Weijun Wang and Yuanchun Li and Linghe Kong and Yunxin Liu},
  journal= {arXiv preprint arXiv:2405.17741},
  year   = {2024}
}