面向异构分布式推理的模型无关混合分片
人工智能
2024-07-30 v1 计算与语言
密码学与安全
分布式、并行与集群计算
摘要
大规模 AI 模型,尤其是大型语言模型的快速增长带来了数据隐私、计算资源和可访问性方面的重大挑战。传统的集中式架构常常难以满足数据安全和可扩展性需求,阻碍了 AI 系统的民主化。Nesa 提出一种面向分布式 AI 推理的模型无关分片框架。该框架采用基于区块链的顺序深度神经网络分片,将计算任务基于个人化启发式和路由机制在异构节点网络中分布。实现即使在消费级硬件上也能高效进行最新大规模模型的分布式训练和推理。我们采用压缩技术,如动态块级量化和混合矩阵分解,以减少数据传输和内存需求。我们还集成了健壮的安全措施,包括基于硬件的受信任执行环境,以确保数据完整性和保密性。在各种自然语言处理和视觉任务上的评估表明,这些压缩策略不会损害模型准确性。我们的结果凸显了通过在分布式网络中实现安全高效推理, democratize access to cutting-edge AI 技术的潜力。
引用
@article{arxiv.2407.19775,
title = {Model Agnostic Hybrid Sharding For Heterogeneous Distributed Inference},
author = {Claudio Angione and Yue Zhao and Harry Yang and Ahmad Farhan and Fielding Johnston and James Buban and Patrick Colangelo},
journal= {arXiv preprint arXiv:2407.19775},
year = {2024}
}