用于增强跨疾病和人群预测性能的通用人口统计基础模型
机器学习
2025-10-15 v2 人工智能
摘要
人口统计属性普遍存在于电子健康记录中。它们是跨人群和跨疾病最广泛的信息,并在临床风险分层和治疗决策中作为重要的预测因子。尽管这些属性意义重大,但在模型设计中常被当作辅助信息,对其表示学习的关注有限。本研究探索了开发一个通用人口统计预训练(GDP)模型,作为专门针对人口统计属性(重点关注年龄和性别)的基础模型。该模型使用来自不同地理区域、具有多样化疾病和人群组成的数据集进行预训练和评估。通过考察排序方法和编码方法的组合,探索了 GDP 架构的构成,以将表格形式的人口统计输入转化为有效的潜在嵌入。结果证明了 GDP 在任务、疾病和人群间泛化的可行性。在具体构成上,顺序排序显著提升了模型在区分度、校准度以及每个决策树分裂的相应信息增益方面的性能,尤其是在年龄和性别对风险分层贡献显著的疾病中。即使在人口统计属性预测价值相对较低的数据集中,GDP 也能增强其表示重要性,增加它们在下游梯度提升模型中的影响力。研究结果表明,针对表格人口统计属性的基础模型为提升医疗保健应用中的预测性能提供了一个有前景的方向。
引用
@article{arxiv.2509.07330,
title = {General Demographic Foundation Models for Enhancing Predictive Performance Across Diseases and Populations},
author = {Li-Chin Chen and Ji-Tian Sheu and Yuh-Jue Chuang},
journal= {arXiv preprint arXiv:2509.07330},
year = {2025}
}