中文

PRIME-CVD:面向心血管风险建模教育的可参数化渲染医疗信息环境

机器学习 2026-03-23 v1

摘要

近年来,随着开放可获取基准数据集的可用性,医学信息学和机器学习的进步得到了加速。然而,由于隐私、治理和重新识别风险,患者水平的电子医疗记录(EMR)数据几乎不可用于教学或方法论开发。这限制了可重复性、透明度和心里理训练在心血管风险建模中的实施。本文引入PRIME-CVD,一个专为医学教育设计的可参数化渲染医疗信息环境。PRIME-CVD由两个开放可获取的合成数据资产组成,代表了50,000名接受心血管疾病一级预防的成年人群。这些数据集完全基于用户指定的因果有向无环图(DAG)参数化生成,参数化使用公开的澳大利亚人口统计数据和已发表的流行病学效应估计,而非来自患者水平的EMR数据或训练的生成模型。数据资产1提供干净、分析就绪的队列,适用于探索性分析、分层和存活建模;数据资产2将相同的队列重新结构化为具有真实结构和词汇异质性的关系型EMR风格数据库。总体而言,这些资产使教育能够在数据清洗、数据一致性、因果推理和政策相关风险建模中实现,而不会暴露敏感信息。由于所有个体和事件都是全新生成的,PRIME-CVD保留了真实的亚群不平衡和风险梯度,同时确保几乎没有披露风险。PRIME-CVD在Creative Commons Attribution 4.0许可证下发布,以支持可重复研究和可扩展的医学教育。

关键词

引用

@article{arxiv.2603.19299,
  title  = {PRIME-CVD: A Parametrically Rendered Informatics Medical Environment for Education in Cardiovascular Risk Modelling},
  author = {Nicholas I-Hsien Kuo and Marzia Hoque Tania and Blanca Gallego and Louisa Jorm},
  journal= {arXiv preprint arXiv:2603.19299},
  year   = {2026}
}