中文

医疗保健中可扩展且安全的AI推理:Kubernetes上FastAPI与Triton推理服务器的比较基准测试

人工智能 2026-02-03 v1 机器学习

摘要

机器学习(ML)模型的高效且可扩展部署是现代生产环境的先决条件,尤其是在医疗保健和制药等受监管领域。在这些环境中,系统必须平衡相互竞争的需求,包括最小化实时临床决策支持的推理延迟、最大化医疗记录批处理的吞吐量,以及确保严格遵守HIPAA等数据隐私标准。本文对两种突出的部署范式进行了严格的基准测试分析:一种基于Python的轻量级REST服务(使用FastAPI),以及一种专门的高性能服务引擎(NVIDIA Triton推理服务器)。利用医疗保健AI的参考架构,我们在Kubernetes上部署了一个DistilBERT情感分析模型,在受控实验条件下测量了中位数(p50)和尾部(p95)延迟以及吞吐量。我们的结果表明存在明显的权衡。虽然FastAPI在单请求工作负载下开销较低,p50延迟为22毫秒,但Triton通过动态批处理实现了卓越的可扩展性,在单个NVIDIA T4 GPU上提供每秒780个请求的吞吐量,几乎是基线的两倍。此外,我们评估了一种混合架构方法,该方法利用FastAPI作为受保护健康信息去标识化的安全网关,并使用Triton进行后端推理。本研究验证了混合模型作为企业临床AI的最佳实践,并为安全、高可用性的部署提供了蓝图。

关键词

引用

@article{arxiv.2602.00053,
  title  = {Scalable and Secure AI Inference in Healthcare: A Comparative Benchmarking of FastAPI and Triton Inference Server on Kubernetes},
  author = {Ratul Ali},
  journal= {arXiv preprint arXiv:2602.00053},
  year   = {2026}
}

备注

2 pages, 2 figures, 1 table