面向小规模高维生物数据的隐私保护联邦无监督域适应回归
机器学习
2025-02-14 v2
摘要
机器学习模型在因数据收集差异和人口差异导致的域迁移问题下,往往难以在小规模异构数据集上实现泛化。这一挑战在生物数据中尤为突出,因为生物数据具有高维、小规模且分布在不同机构的特性。虽然联邦域适应方法(FDA)旨在解决这些挑战,但大多数现有方法依赖深度学习,仅聚焦于分类任务,难以适用于小规模高维场景。本文提出了 freda(Federated Regression with Gaussian Processes for Domain Adaptation)方法,一种针对回归任务的隐私保护联邦方法。不同于基于深度学习的 FDA 方法,freda 是首个能够通过随机编码和安全聚合实现联邦训练高斯过程(Gaussian Process)的方法,能够建模复杂特征关系,同时确保数据完全隐私。这使得其在不直接访问原始数据的情况下实现有效的域适应,特别适用于高维异构数据集的应用场景。我们在从 DNA 甲基数据进行年龄预测这一具有挑战性的任务上评估了 freda,结果表明其在保持完全数据隐私的前提下,性能可与集中式最先进方法相当。
引用
@article{arxiv.2411.17287,
title = {Privacy-Preserving Federated Unsupervised Domain Adaptation for Regression on Small-Scale and High-Dimensional Biological Data},
author = {Cem Ata Baykara and Ali Burak Ünal and Nico Pfeifer and Mete Akgün},
journal= {arXiv preprint arXiv:2411.17287},
year = {2025}
}