渐进式尺寸自适应联邦学习:面向异构多模态数据系统的综合框架
机器学习
2025-09-23 v2 人工智能
摘要
联邦学习 (Federated Learning, FL) 作为一种在保持数据隐私的前提下进行分布式机器学习的变革性范式,正在迅速发展。然而,现有方法主要关注模型异构性和聚合技术,基本上忽略了数据集大小特征对联邦训练动力学的根本性影响。本文引入了基于尺度的自适应联邦学习 (Size-Based Adaptive Federated Learning, SAFL),这是一个系统性地依据跨异构多模态数据中数据集大小特征组织联邦学习的新型渐进式训练框架。我们的全面实验评估覆盖 13 个多样化数据集,涵盖 7 种模态(视觉、文本、时间序列、音频、传感器、医学视觉和多模态),揭示了关键见解:1) 联邦学习有效性的最佳数据集大小范围为 1000-1500 样本;2) 模态性能存在明确的层级结构,其中结构化数据(时间序列、传感器)显著优于非结构化数据(文本、多模态);3) 对于超过 2000 样本的大数据集,系统会出现显著的性能退化。SAFL 在所有数据集上实现了 87.68% 的平均准确率,其中结构化数据模态的准确率可达 99%+。该框架在通信效率方面表现出优越性能,在 558 次通信中将总数据传输量降至 7.38 GB。我们的实时监控框架提供了对系统资源利用、网络效率和训练动力学的前所未有的洞见。这一工作填补了理解数据特征应如何驱动联邦学习策略之间的关键性空白,为神经网络和学习系统在实际场景中的联邦学习部署提供了理论洞见和实用指导。
引用
@article{arxiv.2506.20685,
title = {Progressive Size-Adaptive Federated Learning: A Comprehensive Framework for Heterogeneous Multi-Modal Data Systems},
author = {Sajid Hussain and Muhammad Sohail and Nauman Ali Khan and Naima Iltaf and Ihtesham ul Islam},
journal= {arXiv preprint arXiv:2506.20685},
year = {2025}
}
备注
Due to some technical issues