Loquetier:用于统一 LLM 微调和推理的虚拟化多 LoRA 框架
机器学习
2025-11-04 v1 人工智能
摘要
低秩适应(LoRA)已成为大语言模型(LLM)适用于下游任务的参数高效微调(PEFT)技术中广泛采用的方法。尽管已有工作探索了整合 LLM 训练和推理的策略,但在统一 LoRA 类型模型的微调与推理方面仍存在差距。我们提出 Loquetier,一种虚拟化多 LoRA 框架,能够在单个运行时环境中无缝集成 LoRA 微调和推理。Loquetier 引入了两个关键组件:(1)一种虚拟化模块,用于隔离 PEFT 类型的修改并支持多个适配器共享基础模型;(2)一种优化计算流程,其内核设计将微调和推理路径在前向传播中合并,实现高效批处理并最小化内核调用开销。广泛的实验在三个任务设置下表明,Loquetier 在性能和灵活性方面均优于现有基线,在仅推理任务上实现推理-only 任务的吞吐量提升最高可达 所谱的协同服务系统,在统一微调和推理任务中实现 SLO 达成率提升最高可达 。Loquetier 的实现已公开于 https://github.com/NJUDeepEngine/Loquetier。
引用
@article{arxiv.2511.00101,
title = {Loquetier: A Virtualized Multi-LoRA Framework for Unified LLM Fine-tuning and Serving},
author = {Yuchen Zhang and Hanyue Du and Chun Cao and Jingwei Xu},
journal= {arXiv preprint arXiv:2511.00101},
year = {2025}
}
备注
26 pages including 10 pages of main text, 6 figures, 39th Conference on Neural Information Processing Systems (NeurIPS 2025)