FedLLM-Align:面向异构客户端的特征提取
机器学习
2026-02-02 v2
摘要
联邦学习(FL)通过不共享原始数据实现协作模型训练,因而在医疗、金融和物联网等隐私敏感领域备受青睐。然而,在实际场景中,表格数据的异构性可能导致模式不匹配和特征空间不兼容,阻碍直接聚合。这篇论文提出FedLLM-Align,一种基于预训练变换器语言模型进行特征提取的联邦学习框架。为此目标,FedLLM-Align将表格记录序列化为文本,从预训练LLM编码器(如DistilBERT)中派生语义对齐的嵌入, facilitate lightweight本地分类器头可通过标准聚合方案(如FedAvg)进行联邦训练,同时保持所有原始数据记录本地。为量化FedLLM-Align的优势与权衡,我们在两个不同领域的二分类任务上对该框架进行了评估:i)基于分割Framingham Heart Study数据进行冠状动脉疾病预测,ii)基于金融数据集进行客户流失预测。在模拟schema异构性下,FedLLM-Align相较于最先进(SOTA)基线在F1分数上提升最高可达25%,通信开销降低65%。这些结果表明,FedLLM-Align是一种面向异构表格数据集的隐私保护和通信高效的联邦训练方法,这在实际应用中常见。
引用
@article{arxiv.2510.00065,
title = {FedLLM-Align: Feature Extraction From Heterogeneous Clients},
author = {Abdelrhman Gaber and Muhammad ElMahdy and Youssif Abuzied and Hassan Abd-Eltawab and Tamer ElBatt},
journal= {arXiv preprint arXiv:2510.00065},
year = {2026}
}