中文

非IID数据下基于多任务自编码器的联邦学习样本选择

计算机视觉与模式识别 2026-04-30 v1 机器学习

摘要

联邦学习是一种机器学习范式,其中多个设备在中心服务器的监督下协同时训练模型,同时确保数据隐私。然而,其性能常受到冗余、恶意或异常样本的阻碍,导致模型退化和低效。为克服这些问题,我们提出了针对图像分类的 novel sample selection 方法,采用多任务自编码器通过损失和特征分析估计样本贡献。我们的methods incorporates unsupervised outlier detection,使用一个-one-class support vector machine (OCSVM)、孤立森林 (IF) 和自适应损失阈值 (AT) 方法由中心服务器筛选客户端上的噪声样本。我们还提出了受中心服务器控制的多类深度支持向量数据描述 (SVDD) loss 以增强基于特征的样本选择。我们在 CIFAR10 和 MNIST 数据集上对方法进行了验证,测试不同的客户端数量、非IID 分布和最高可达 40% 的噪声水平。结果表明,基于损失的样本选择显著提高了准确率,在 OCSVM 下的 CIFAR10 上实现最高提升 7.02%,在 AT 下的 MNIST 上实现最高提升 1.83%。此外,我们的联邦 SVDD loss 进一步提高了基于特征的样本选择,在 OCSVM 下的 CIFAR10 上实现最高提升 0.99%。这些结果表明我们的方法在各种客户端数量和噪声条件下提高了模型准确率。

关键词

引用

@article{arxiv.2604.26116,
  title  = {Sample Selection Using Multi-Task Autoencoders in Federated Learning with Non-IID Data},
  author = {Emre Ardıç and Yakup Genç},
  journal= {arXiv preprint arXiv:2604.26116},
  year   = {2026}
}

备注

Published in Engineering Science and Technology, an International Journal, 61 (2025), 101920. DOI: https://doi.org/10.1016/j.jestch.2024.101920 and Codes: https://github.com/eardic/FL_DPQS