面向 democratizing 大型语言模型 serving 的去中心化、可扩展且隐私保护的覆盖网络——PlanetServe
分布式、并行与集群计算
2026-02-16 v5 人工智能
摘要
尽管在开源和高性价比的大型语言模型(LLM)方面取得了显著进展,但 serving 的可扩展性仍是一个关键挑战,尤其是对于寻求部署和测试其 LLM 创新的小组织和个人而言。灵感来自利用去中心化覆盖节点来提高吞吐量和可用性的点对点网络,我们提出了 GenTorrent,一种 LLM serving overlay,利用来自去中心化贡献者的计算资源。我们确定了启用此类去中心化基础设施的四个关键研究问题:1) 覆盖网络组织;2) LLM 通信隐私;3) 覆盖转发以实现资源效率;4) serving quality 的验证。本 work 首次系统性地研究了去中心化 LLM serving 中的这些基本问题。在在一组去中心化节点上实现的原型评估结果表明,GenTorrent 相较于无覆盖转发的基线设计实现了 50% 以上的延迟降低。此外,安全特性对 serving 延迟和吞吐量的引入几乎没有产生额外开销。我们认为本 work 为 democratizing 和扩展未来 AI serving 能力开辟了新的方向。
引用
@article{arxiv.2504.20101,
title = {PlanetServe: A Decentralized, Scalable, and Privacy-Preserving Overlay for Democratizing Large Language Model Serving},
author = {Fei Fang and Yifan Hua and Shengze Wang and Ruilin Zhou and Yi Liu and Chen Qian and Xiaoxue Zhang},
journal= {arXiv preprint arXiv:2504.20101},
year = {2026}
}