中文

Chat AI: A Seamless Slurm-Native Solution for HPC-Based Services

分布式、并行与集群计算 2024-08-05 v2 人工智能

摘要

大型语言模型(LLM)的广泛采用,使得高效、安全且私密的服务基础设施需求迫切,这些基础设施允许研究人员运行开源或自定义微调的 LLM,并确保用户数据在获得同意前不被存储。虽然配备最新 GPU 的高性能计算(HPC)系统非常适合训练 LLM,但其批处理调度范式并非为支持 AI 应用的实时服务而设计。云系统另一方面适合 Web 服务,却常常缺乏对 HPC 集群特别是昂贵且稀缺的高端 GPU 的访问权限,这些 GPU 对实现最佳推理速度至关重要。我们提出一种架构,其实现包括运行于云 VM 上的 Web 服务,securely access 一个在 HPC 系统上运行大量 LLM 模型的可扩展后端。通过提供基于我们 HPC 基础设施托管 LLM 的 Web 服务,我们利用当地大学和研究中心的可信环境,提供一个私密且安全的商业 LLM 服务的替代方案。我们的解决方案原生集成 HPC 批处理调度器 Slurm,实现在 HPC 集群上的无缝部署,能够与常规 Slurm 工作负载并行运行,同时利用 Slurm 创建的排程间隙。为确保 HPC 系统的安全,我们使用 SSH ForceCommand 指令构建一个稳健的熔断器,防止针对公开服务器的攻击成功后影响整个集群。我们已成功将系统部署为生产服务,并在 \url{https://github.com/gwdg/chat-ai} 上公开源码。

关键词

引用

@article{arxiv.2407.00110,
  title  = {Chat AI: A Seamless Slurm-Native Solution for HPC-Based Services},
  author = {Ali Doosthosseini and Jonathan Decker and Hendrik Nolte and Julian M. Kunkel},
  journal= {arXiv preprint arXiv:2407.00110},
  year   = {2024}
}

备注

Various improvements to explanations and form and updated graphs to include data points up to 30.07.2024