中文

Symbiosis:多适配器推理与微调

分布式、并行与集群计算 2025-10-24 v3 人工智能 机器学习

摘要

参数高效微调(PEFT)技术允许模型构建者将任务特定参数捕获到适配器中,这些适配器的规模仅为原始基模型的一小部分。PEFT技术在微调方面的流行导致了大量为流行的大语言模型(LLM)创建适配器。然而,现有框架在以下方面不足以支持多适配器的推理或微调:1)对于微调,每个作业需要部署其专用的基模型实例,这导致GPU内存消耗过度且GPU利用率不佳。2)虽然流行的推理平台可以为多个PEFT适配器提供服务,但它们不允许独立的资源管理或混合不同的PEFT方法。3)它们无法有效利用异构加速器。4)它们不提供给不希望向服务提供商暴露其微调参数的用户提供隐私。在Symbiosis中,我们通过启用基模型的即服务部署来解决上述问题。基模型层可以跨越多个推理或微调进程进行共享。我们的分层执行技术将客户端特定的适配器和层的执行与冻结的基模型层分离,为他们提供了灵活的资源管理、选择其微调方法、实现其性能目标的机会。我们的做法对模型透明,且可即插即用地适用于transformers库中大多数模型。我们展示了使用Symbiosis在8个GPU上同时微调20个Gemma2-27B适配器的用例。

关键词

引用

@article{arxiv.2507.03220,
  title  = {Symbiosis: Multi-Adapter Inference and Fine-Tuning},
  author = {Saransh Gupta and Umesh Deshpande and Travis Janssen and Swami Sundararaman},
  journal= {arXiv preprint arXiv:2507.03220},
  year   = {2025}
}