中文

基于 Apache Spark 的医疗数据分布式记录链接

分布式、并行与集群计算 2024-04-12 v1 机器学习

摘要

医疗数据是医学领域研究、分析和决策的宝贵资源。然而,医疗数据通常是碎片化的并分布在各种来源中,这使得有效地组合和分析它们具有挑战性。记录链接,也称为数据匹配,是集成和清理医疗数据以确保数据质量和准确性的关键步骤。Apache Spark 是一个强大的开源分布式大数据处理框架,在其机器学习库的辅助下,为执行记录链接任务提供了一个稳健的平台。在本研究中,我们基于 Apache Spark 机器学习库开发了一个新的分布式数据匹配模型。为了确保模型的正确运行,我们在训练数据上进行了验证。主要的挑战是数据不平衡,因为大量数据被标记为假,而少量记录被标记为真。通过利用 SVM 和回归算法,我们的结果表明研究数据既没有过拟合也没有欠拟合,这表明我们的分布式模型在数据上运行良好。

关键词

引用

@article{arxiv.2404.07939,
  title  = {Distributed Record Linkage in Healthcare Data with Apache Spark},
  author = {Mohammad Heydari and Reza Sarshar and Mohammad Ali Soltanshahi},
  journal= {arXiv preprint arXiv:2404.07939},
  year   = {2024}
}

备注

6 pages, 5 figures