中文

面向部分重叠临床数据的联邦随机森林

机器学习 2024-06-03 v1

摘要

在医疗保健领域,对数据隐私和相关数据保护法规的意识,以及异构和非标准化的数据,给大规模数据分析带来了巨大挑战。此外,临床数据通常涉及部分重叠的特征,因为由于各种原因(如不同医院或机构在程序、诊断测试或其他记录的患者历史信息上的差异),某些观测可能缺失。为了解决临床数据集中部分重叠特征和不完整数据带来的挑战,需要一种全面的方法。特别是在医学数据领域,当特征对齐时,联邦随机森林取得了有希望的结果。然而,对于大多数标准算法(如随机森林),所有数据集必须具有相同的参数。因此,在这项工作中,联邦随机森林的概念被调整为部分重叠特征的设置。此外,我们的研究评估了新开发的面向部分重叠临床数据的联邦随机森林模型的有效性。为了聚合联邦全局优化模型,只能使用每个站点本地可用的特征。我们解决了联邦中的两个问题:(i)参与方的数量,(ii)特征重叠的变化。该评估在三个临床数据集上进行。即使在只有部分特征重叠的情况下,联邦随机森林模型也始终表现出优于其本地对应模型的性能。这在各种场景中都成立,包括类别不平衡的数据集。因此,面向部分重叠数据的联邦随机森林为超越合作研究和企业合作中的障碍提供了一种有前景的解决方案。

关键词

引用

@article{arxiv.2405.20738,
  title  = {Federated Random Forest for Partially Overlapping Clinical Data},
  author = {Youngjun Park and Cord Eric Schmidt and Benedikt Marcel Batton and Anne-Christin Hauschild},
  journal= {arXiv preprint arXiv:2405.20738},
  year   = {2024}
}