中文

利用LoRA LMM赋能视觉应用

计算机视觉与模式识别 2025-04-04 v5 人工智能

摘要

大多模态模型(LMM)在各种复杂视觉任务中取得了显著进展,继承了来自大语言模型(LLM)的坚实语言和推理能力。低秩自适应(LoRA)提供了一种有前景的方法,将外部知识集成到LMM中,弥补其在领域特定任务上的局限性。然而,现有的LoRA模型服务计算成本过高,导致极高的延迟。在本文中,我们提出了一种端到端的解决方案,通过LoRA LMM赋能多样化的视觉任务并丰富视觉应用。我们的系统VaLoRA通过以下方式实现准确且高效的视觉任务:1)一种面向精度的LoRA适配器生成方法,生成富含领域特定知识的LoRA适配器以满足应用特定的精度要求;2)一种自适应分块的LoRA适配器批处理算子,高效计算并发的异构LoRA适配器;3)一种灵活的LoRA适配器编排机制,管理应用请求和LoRA适配器以实现最低平均响应延迟。我们在三个LMM上的五个流行视觉任务上原型化了VaLoRA。实验结果表明,VaLoRA相比原始LMM将精度提升了24-62%,相比最先进的LoRA模型服务系统将延迟降低了20-89%。

关键词

引用

@article{arxiv.2411.00915,
  title  = {Empower Vision Applications with LoRA LMM},
  author = {Liang Mi and Weijun Wang and Wenming Tu and Qingfeng He and Rui Kong and Xinyu Fang and Yazhu Dong and Yikang Zhang and Yunchun Li and Meng Li and Haipeng Dai and Guihai Chen and Yunxin Liu},
  journal= {arXiv preprint arXiv:2411.00915},
  year   = {2025}
}

备注

EuroSys'2025