中文

vLLM-Omni:面向任意多模态模型的完全解耦式服务

分布式、并行与集群计算 2026-02-03 v1

摘要

能够联合处理文本、图像、视频和音频的任意到任意多模态模型代表了多模态人工智能的重大进步。然而,其复杂的体系结构(通常结合多个自回归 LLM、扩散变换器和其他专用组件)为高效模型服务带来了重大挑战。现有的服务系统主要针对单一范式进行优化,如用于文本生成的自回归 LLM 或用于视觉生成的扩散变换器。它们缺乏对涉及多个相互关联模型组件的任意到任意管道的支持。结果,开发者必须手动处理跨阶段交互,导致显著的性能下降。我们提出了 vLLM-Omni,一个面向任意到任意模型的完全解耦式服务系统。vLLM-Omni 特色是一种新颖的阶段抽象,使用户能够将复杂的任意到任意体系结构分解为 interconnected 阶段,呈图形表示;以及解耦式阶段执行后端,可优化各阶段的资源利用和吞吐量。每个阶段由 LLM 或扩散引擎独立服务,支持 per-stage 请求批处理、灵活的 GPU 分配以及统一的跨阶段连接器用于数据路由。实验结果表明,vLLM-Omni 将作业完成时间(JCT)缩短最高可达 91.4%。代码已公开available at https://github.com/vllm-project/vllm-omni。

关键词

引用

@article{arxiv.2602.02204,
  title  = {vLLM-Omni: Fully Disaggregated Serving for Any-to-Any Multimodal Models},
  author = {Peiqi Yin and Jiangyun Zhu and Han Gao and Chenguang Zheng and Yongxiang Huang and Taichang Zhou and Ruirui Yang and Weizhi Liu and Weiqing Chen and Canlin Guo and Didan Deng and Zifeng Mo and Cong Wang and James Cheng and Roger Wang and Hongsheng Liu},
  journal= {arXiv preprint arXiv:2602.02204},
  year   = {2026}
}

备注

12 pages, 8 figures