中文

从UNOS器官捐献者文档中进行大规模数据提取

计算机视觉与模式识别 2024-01-08 v3 图像与视频处理

摘要

本文关注三个主要任务:1)讨论我们的方法:我们的方法捕获了DCD流程表、肾脏灌注数据以及器官恢复手术周边捕获的流程表数据中的一部分数据。2)展示结果:我们基于2022年OPTN数据构建了一个全面、可分析的数据库。该数据集即使在初步阶段也远大于以往任何可用数据;以及3)证明我们的方法可推广至所有过去的OPTN数据与未来数据。我们的研究范围是自2008年以来美国所有器官获取与移植网络(OPTN)的器官捐献者数据。过去这些数据无法大规模分析,因为它们以称为“附件”的PDF文档形式捕获,每位捐献者的信息以异构格式记录于数十个PDF文档中。为使数据可分析,需将这些PDF中的内容转换为可分析的数据格式,例如标准SQL数据库。本文聚焦于2022年OPTN数据,其由约400,000\approx 400,000个PDF文档组成,跨度数百万页。整个OPTN数据涵盖15年(2008–2022)。本文假定读者熟悉OPTN数据的内容。

关键词

引用

@article{arxiv.2308.15752,
  title  = {Large-scale data extraction from the UNOS organ donor documents},
  author = {Marek Rychlik and Bekir Tanriover and Yan Han},
  journal= {arXiv preprint arXiv:2308.15752},
  year   = {2024}
}