中文

Loquetier:用于统一 LLM 微调和推理的虚拟化多 LoRA 框架

机器学习 2025-11-04 v1 人工智能

摘要

低秩适应(LoRA)已成为大语言模型(LLM)适用于下游任务的参数高效微调(PEFT)技术中广泛采用的方法。尽管已有工作探索了整合 LLM 训练和推理的策略,但在统一 LoRA 类型模型的微调与推理方面仍存在差距。我们提出 Loquetier,一种虚拟化多 LoRA 框架,能够在单个运行时环境中无缝集成 LoRA 微调和推理。Loquetier 引入了两个关键组件:(1)一种虚拟化模块,用于隔离 PEFT 类型的修改并支持多个适配器共享基础模型;(2)一种优化计算流程,其内核设计将微调和推理路径在前向传播中合并,实现高效批处理并最小化内核调用开销。广泛的实验在三个任务设置下表明,Loquetier 在性能和灵活性方面均优于现有基线,在仅推理任务上实现推理-only 任务的吞吐量提升最高可达 3.0×3.0\times 所谱的协同服务系统,在统一微调和推理任务中实现 SLO 达成率提升最高可达 46.4×46.4\times。Loquetier 的实现已公开于 https://github.com/NJUDeepEngine/Loquetier。

关键词

引用

@article{arxiv.2511.00101,
  title  = {Loquetier: A Virtualized Multi-LoRA Framework for Unified LLM Fine-tuning and Serving},
  author = {Yuchen Zhang and Hanyue Du and Chun Cao and Jingwei Xu},
  journal= {arXiv preprint arXiv:2511.00101},
  year   = {2025}
}

备注

26 pages including 10 pages of main text, 6 figures, 39th Conference on Neural Information Processing Systems (NeurIPS 2025)