KAITIAN:面向嵌入式 AI 系统中异构加速器高效协作的统一通信框架
分布式、并行与集群计算
2025-05-16 v1 人工智能
摘要
嵌入式人工智能 (AI) 系统,如自主机器人和智能车辆,正越来越依赖于多样化的异构加速器 (如 GPGPU、NPU、FPGA) 以满足严格的实时处理和能效需求。然而,厂商特定的专有通信库的 proliferation 导致了显著的互操作性障碍,阻碍了不同加速器类型之间的无缝协作,导致资源利用不足和分布式 AI 工作负载中的性能瓶颈。本文引入 KAITIAN,一个旨在填补这一差距的新型分布式通信框架。KAITIAN 提供了一个智能集成厂商优化通信库以实现组内效率,并使用通用通信协议实现组间互操作性的统一抽象层。关键地,incorporates 一种负载自适应调度机制,用于根据实时性能特征动态平衡跨异构设备的计算任务。作为对 PyTorch 的一个扩展实现,KAITIAN 在包含 NVIDIA GPU 和 Cambricon MLU 的测试平台上进行严格评估。实验结果表明,KAITIAN 在分布式训练任务方面显著改善了资源利用率和可扩展性。实验结果显示,KAITIAN 相对于基线均匀系统可加快训练时间最高可达 42%,同时仅引入最小的通信开销 (2.8--4.3%),并保持模型准确性。KAITIAN 为复杂嵌入式 AI 应用的更灵活和强大的异构计算铺平了道路。
引用
@article{arxiv.2505.10183,
title = {KAITIAN: A Unified Communication Framework for Enabling Efficient Collaboration Across Heterogeneous Accelerators in Embodied AI Systems},
author = {Jieke Lin and Wanyu Wang and Longxiang Yin and Yinhe Han},
journal= {arXiv preprint arXiv:2505.10183},
year = {2025}
}
备注
9 pages, 4 figures. Jieke Lin and Wanyu Wang contributed equally to this work