重新定义计算机视觉任务中联邦学习的非IID数据:从标签迁移到嵌入以实现任务特定的数据分布
计算机视觉与模式识别
2026-03-25 v5 机器学习
摘要
联邦学习(FL)已成为分布式机器学习(ML)的突出范式之一。然而,众所周知,当客户端之间的数据分布为非独立同分布(non-IID)时,其性能会显著下降。为了研究这种效应,现有工作主要通过施加标签分布偏斜来模拟数据异质性。在本文中,我们表明标签分布偏斜未能完全捕捉计算机视觉任务中超越分类的数据异质性,暴露了文献中被忽视的空白。受此启发,我们利用预训练的深度神经网络提取任务特定的数据嵌入,通过每个视觉任务的视角定义任务特定的数据异质性,并引入了一种新的数据异质性层次——基于嵌入的数据异质性。我们的方法涉及基于嵌入对数据点进行聚类,并使用狄利克雷分布将它们分配给客户端。通过广泛的实验,我们评估了不同联邦学习方法在我们重新定义的数据异质性概念下的性能,为文献引入了新的基准性能指标。例如,在七个代表性的计算机视觉任务中,我们的基于嵌入的异质性表述导致在FedAvg下观察到的损失增加了约60%,表明它更准确地揭示了数据异质性导致的性能下降。我们进一步揭示了一系列可探索的开放研究方向。(代码:https://github.com/KasraBorazjani/task-perspective-het.git)
引用
@article{arxiv.2503.14553,
title = {Redefining non-IID Data in Federated Learning for Computer Vision Tasks: Migrating from Labels to Embeddings for Task-Specific Data Distributions},
author = {Kasra Borazjani and Payam Abdisarabshali and Naji Khosravan and Seyyedali Hosseinalipour},
journal= {arXiv preprint arXiv:2503.14553},
year = {2026}
}
备注
Accepted for publication in IEEE Transactions on Artificial Intelligence, 2026