中文

面向翻译性研究的电子健康记录数据整合通用管线

机器学习 2025-12-04 v3 机器学习

摘要

尽管电子健康记录 (EHR) 数据的获取量不断增长,但研究人员往往面临在实际中有效利用这些数据进行翻译性研究的重大障碍,这些数据的复杂性、异构性以及缺乏标准化工具和文档。为此,我们提出了 PEHRT,一个面向翻译性研究的 EHR 数据整合通用管线。PEHRT 是一个全面且即插即用的资源,包括开源代码、可视化工具和详细文档,以简化准备 EHR 数据进行分析的过程。该管线提供工具将结构化和非结构化 EHR 数据整合到标准本体法中,以确保跨不同编码系统的一致性。在存在未映射或本土异构编码的情况下,PEHRT 进一步利用表征学习和预训练语言模型生成稳健的嵌入,捕捉跨站点间的语义关系,从而缓解异构性并支持集成的下游分析。PEHRT 还支持跨机构联合训练,通过共享表征实现,使参与机构能够在不共享个人数据的情况下协同细化嵌入并提升泛化能力。该框架数据模型中立,可在 diverse healthcare systems 中无缝部署,以产生可互操作且研究就绪的数据集。通过降低 EHR 基于研究的技术障碍,PEHRT 使研究者能够将原始临床数据转化为可重复、分析就绪的资源,用于发现和创新。

关键词

引用

@article{arxiv.2509.08553,
  title  = {A Common Pipeline for Harmonizing Electronic Health Record Data for Translational Research},
  author = {Jessica Gronsbell and Vidul Ayakulangara Panickan and Doudou Zhou and Chris Lin and Thomas Charlon and Chuan Hong and Xin Xiong and Linshanshan Wang and Jianhui Gao and Shirley Zhou and Yuan Tian and Yaqi Shi and Ziming Gan and Tianxi Cai},
  journal= {arXiv preprint arXiv:2509.08553},
  year   = {2025}
}