数据保护约束下用于生物标志物选择的分布式多元回归建模
机器学习
2023-10-03 v3 密码学与安全
分布式、并行与集群计算
摘要
临床生物标志物的发现需要大型患者队列,并得益于跨机构的汇总数据方法。在许多国家,数据保护约束,尤其在临床环境中,禁止不同研究机构之间交换个体水平数据,阻碍了联合分析的实施。为规避此问题,仅交换非披露性的聚合数据,这通常以人工方式进行且传输前需明确许可,即数据调用次数与数据量应受限制。这不允许进行变量选择等更复杂的任务,因为通常只传输简单的聚合汇总统计量。已有其他方法被提出,它们需要更复杂的聚合数据或使用输入数据扰动,但这些方法要么无法处理大量生物标志物,要么会丢失信息。在此,我们提出一种基于迭代调用中聚合数据的自动变量选择多元回归方法用于识别生物标志物,其可在数据保护约束下实现。该方法可用于联合分析分布在多个地点的数据。为最小化传输数据量与调用次数,我们还提供了该方法的启发式变体。在执行全局数据标准化时,所提方法与汇总个体水平数据分析得出相同结果。在模拟研究中,局部标准化带来的信息损失极小。在典型场景下,启发式方法将数据调用次数从十余次降至 3 次,使人工数据发布可行。为使我们的方法得以广泛应用,我们提供了集成于 DataSHIELD 框架中的启发式版本实现。
引用
@article{arxiv.1803.00422,
title = {Distributed Multivariate Regression Modeling For Selecting Biomarkers Under Data Protection Constraints},
author = {Daniela Zöller and Harald Binder},
journal= {arXiv preprint arXiv:1803.00422},
year = {2023}
}