I-ETL:支持联邦分析的互操作感知健康(元)数据流水线
数据库
2025-09-29 v1
摘要
临床医生希望更好地了解癌症或罕见疾病等复杂疾病,因此他们需要产生并交换数据以共享资源并形成合力。为此并确保隐私,一种自然的方式是采用去中心化架构和联邦学习算法。这确保了数据留在收集它的机构中,但要求在相似的设置和相似的模型下收集数据。在实践中,情况往往并非如此,因为医疗机构各自独立工作,使用不同的表示和原始数据;他们没有手段来标准化其数据,更不用说跨中心进行标准化了。例如,临床医生手头有表型、临床、影像和基因组数据(各自独立收集),希望通过共同分析来更好地了解某些疾病。这个例子突显了合作利用这些丰富信息的需求与挑战。我们设计并实现了一个名为 I-ETL 的框架,用于将医院的高度异构医疗数据集集成到互操作数据库中。我们的提案包含两部分:(i) 我们设计了两个通用且可扩展的概念模型,用于对数据和元数据进行建模;(ii) 我们提出了一条 Extract-Transform-Load (ETL) 流水线,从一开始就确保并评估互操作性。通过在开源数据集上进行实验,我们表明得益于我们的两个通用概念模型,I-ETL 成功地以统一方式表示了各种医疗数据集。接下来,我们展示了将互操作性作为首要考量融入集成流水线的重要性,确保了不同中心之间可能的协作。
引用
@article{arxiv.2509.22351,
title = {I-ETL: an interoperability-aware health (meta) data pipeline to enable federated analyses},
author = {Nelly Barret and Anna Bernasconi and Boris Bikbov and Pietro Pinoli},
journal= {arXiv preprint arXiv:2509.22351},
year = {2025}
}