中文

Fed-MIWAE:基于深度生成模型的不完整数据联邦插补

机器学习 2023-04-18 v1 机器学习

摘要

联邦学习允许在多个去中心化本地数据集上训练机器学习模型而无需显式数据交换。然而,数据预处理(包括处理缺失数据的策略)仍是实际联邦学习部署中的主要瓶颈,且通常在本地执行。这种方法可能存在偏差,因为各中心本地观察到的子群体可能不代表总体。为解决此问题,本文首先通过联邦模型提出了一种更具一致性的数据标准化方法。此外,我们提出了 Fed-MIWAE,即最先进插补方法 MIWAE 的联邦版本,一种基于变分自编码器的用于缺失数据插补的深度潜变量模型。MIWAE 具有可使用经典联邦聚合器轻松训练的巨大优势。此外,它能够处理 MAR(随机缺失)数据,这是一种比 MCAR(完全随机缺失)更具挑战性的缺失数据机制,其中变量的缺失可依赖于已观测变量。我们在来自 ADNI 数据集的模拟联邦场景下的多模态医学影像数据及临床评分上评估了我们的方法。我们将 Fed-MIWAE 与经典的插补方法(本地或集中式执行)进行比较。Fed-MIWAE 即使在本地的数据分布高度异质时,也能达到与最佳集中式方法相当的插补精度。此外,得益于 Fed-MIWAE 的变分特性,我们的方法被设计用于执行多重插补,从而能在联邦场景下量化插补不确定性。

关键词

引用

@article{arxiv.2304.08054,
  title  = {Fed-MIWAE: Federated Imputation of Incomplete Data via Deep Generative Models},
  author = {Irene Balelli and Aude Sportisse and Francesco Cremonesi and Pierre-Alexandre Mattei and Marco Lorenzi},
  journal= {arXiv preprint arXiv:2304.08054},
  year   = {2023}
}