AIvailable:面向异构和 legacy GPU 的 LLM-as-a-Service 软件定义架构
分布式、并行与集群计算
2025-11-18 v1 人工智能
网络与互联网体系结构
摘要
大型语言模型 (LLM) 的兴起增加了面向可扩展高性能推理系统的需求,但大多数现有框架假设硬件环境均匀且资源丰富,往往不切实际,尤其是在学术或资源受限的环境中。我们引入 AIvailable,一个低成本、高可用的 LLM-as-a-Service (LLMaaS) 平台,采用软件定义方法在包括 NVIDIA 和 AMD 设备在内的异构和 legacy GPU 节点上运行 LLM,重点充分利用每个节点的 VRAM。AIvailable 作为完全 GPU 加速的推理系统,无需 CPU 回退, featuring 一个统一的客户端界面,允许通过单个逻辑单元无缝与所有部署的 LLM 进行交互。该架构由四个主要组件构成:用于用户访问的客户端界面、用于安全请求路由和负载均衡的服务前端、用于编排、部署和监控的 SDAI 控制器,以及执行工作负载的异构 GPU 节点服务后端。通过抽象 GPU 特定细节并提供动态、VRAM 感知的模型分配和重新分配,AIvailable 确保资源高效利用,并具备对故障或工作负载波动的韧性。针对学术实验室、私营公司及其他受限组织,支持多种开源 LLM,帮助通过回收 legacy GPU 实现生成式 AI 的民主化。
引用
@article{arxiv.2511.11621,
title = {AIvailable: A Software-Defined Architecture for LLM-as-a-Service on Heterogeneous and Legacy GPUs},
author = {Pedro Antunes and Ana Rita Ortigoso and Gabriel Vieira and Daniel Fuentes and Luís Frazão and Nuno Costa and António Pereira},
journal= {arXiv preprint arXiv:2511.11621},
year = {2025}
}