面向多方协同不平衡数据挖掘的无服务器联邦 AUPRC 优化
机器学习
2023-08-08 v1 人工智能
摘要
多方协同训练,如分布式学习和联邦学习,被用于应对大数据挑战。然而,传统的多方协同训练算法主要面向平衡数据挖掘任务设计,并旨在优化准确率(例如交叉熵)。许多实际应用中的数据分布是倾斜的,为提升准确率而训练的分类器在不平衡数据任务上表现不佳,因为模型可能显著偏向于多数类。因此,精确率-召回率曲线下面积(AUPRC)被引入作为一种有效指标。尽管单机的 AUPRC 最大化方法已被设计,但多方协同算法尚未被研究。从单机到多方设置的转变带来了关键挑战。为应对上述挑战,我们研究无服务器多方协同 AUPRC 最大化问题,因为无服务器多方协同训练可通过避免服务器节点瓶颈来降低通信成本,并将其重新表述为无服务器多方协同学习设置下的条件随机优化问题,提出一种新的无服务器偏置随机梯度(SLATE)算法来直接优化 AUPRC。此后,我们利用方差缩减技术并提出带基于动量的方差缩减的无服务器偏置随机梯度(SLATE-M)算法以改善收敛速率,其匹配单机在线方法所达到的最佳理论收敛结果。据我们所知,这是首个解决多方协同 AUPRC 最大化问题的工作。
引用
@article{arxiv.2308.03035,
title = {Serverless Federated AUPRC Optimization for Multi-Party Collaborative Imbalanced Data Mining},
author = {Xidong Wu and Zhengmian Hu and Jian Pei and Heng Huang},
journal= {arXiv preprint arXiv:2308.03035},
year = {2023}
}