中文

基于全局采样的并行拆分学习

机器学习 2026-03-06 v6 人工智能 分布式、并行与集群计算

摘要

并行拆分学习(PSL)存在两个相互交织的问题:有效批次大小随客户端数量增长,以及非独立同分布(non-IID)的数据会扭曲全局批次。我们提出了基于全局采样的并行拆分学习(GPSL),这是一种服务器驱动的方案,它在固定全局批次大小的同时,利用池化比例计算每个客户端的批次大小调度。实际样本由每个选定的客户端在本地无放回地抽取。这消除了每类舍入误差,将有效批次与客户端数量解耦,并使每个全局批次在分布上等同于集中式无放回均匀采样。因此,我们通过 Serfling 不等式获得了有限总体偏差保证,与本地采样方案相比,舍入偏差为零。GPSL 是 PSL 的即插即用替代方案,开销可忽略不计,并可扩展到大规模客户端群体。在 CIFAR-10/100 和 ResNet-18/34 上针对非 IID 划分进行的大量实验中,GPSL 稳定了优化过程并达到了集中式相当的准确率,而固定本地批次的方法落后高达 60%。此外,GPSL 通过避免数据耗尽导致的训练步数膨胀,缩短了训练时间。这些发现表明,GPSL 是一种在资源受限环境中进行学习的有前景且可扩展的方法。

关键词

引用

@article{arxiv.2407.15738,
  title  = {Parallel Split Learning with Global Sampling},
  author = {Mohammad Kohankhaki and Ahmad Ayad and Mahdi Barhoush and Anke Schmeink},
  journal= {arXiv preprint arXiv:2407.15738},
  year   = {2026}
}

备注

Accepted at the 2025 IEEE 3rd International Conference on Foundation and Large Language Models (FLLM). This version corresponds to the accepted manuscript