跨异构脑电图数据集的癫痫发作预测联邦学习
机器学习
2025-08-12 v1
摘要
利用来自多个临床中心的脑电图(EEG)数据开发准确且可泛化的癫痫发作预测模型,受到患者隐私法规和显著的数据异质性(非独立同分布特性)的阻碍。联邦学习(FL)为协作训练提供了一个保护隐私的框架,但像联邦平均(FedAvg)这样的标准聚合方法在异构环境中可能会被占主导地位的数据集所偏置。本文研究了使用单一 EEG 通道在四个不同的公共数据集(Siena、CHB-MIT、Helsinki、NCH)上进行癫痫发作预测的联邦学习,这些数据集代表了不同的患者群体(成人、儿童、新生儿)和记录条件。我们实现了保护隐私的全局归一化,并提出了一种随机子集聚合策略,其中每个客户端在每轮训练中使用其数据的固定大小随机子集,以确保聚合过程中的平等贡献。我们的结果表明,本地训练的模型无法跨中心泛化,并且标准的加权 FedAvg 产生了高度偏斜的性能(例如,在 CHB-MIT 上准确率为 89.0%,但在 Helsinki 上仅为 50.8%,在 NCH 上为 50.6%)。相比之下,随机子集聚合显著提高了代表性不足的客户端的性能(Helsinki 准确率提高到 81.7%,NCH 准确率提高到 68.7%),并在所有中心实现了 77.1% 的宏观平均准确率和 80.0% 的合并准确率,展示了一个更稳健、更公平的全局模型。这项工作突显了平衡的联邦学习方法在现实、异构的多医院环境中构建有效且可泛化的癫痫发作预测系统,同时尊重数据隐私的潜力。
引用
@article{arxiv.2508.08159,
title = {Federated Learning for Epileptic Seizure Prediction Across Heterogeneous EEG Datasets},
author = {Cem Ata Baykara and Saurav Raj Pandey and Ali Burak Ünal and Harlin Lee and Mete Akgün},
journal= {arXiv preprint arXiv:2508.08159},
year = {2025}
}