通过弥合电子病历数据集间数据分布偏移的域不变临床表示学习
机器学习
2025-02-12 v3 人工智能
摘要
新发疾病因可用信息有限,在症状识别和及时临床干预方面带来挑战。有效的预后模型可辅助医生做出准确诊断并制定个性化治疗方案,以预防不良结局。然而,在疾病出现早期,若干因素阻碍了模型开发:数据收集有限、临床经验不足,以及隐私与伦理问题限制了数据可用性并使准确标签分配复杂化。此外,来自不同疾病或来源的电子病历(EMR)数据常表现出显著的跨数据集特征错位,严重影响深度学习模型的有效性。我们提出一种域不变表示学习方法,在源数据集与目标数据集之间构建迁移模型。通过约束跨不同域生成的特征的分布偏移,我们捕获与下游任务具体相关的域不变特征,开发出统一的域不变编码器,可在多种任务域上实现更好的特征表示。在多个目标任务上的实验结果表明,我们提出的模型优于对比基线方法,并在数据有限时实现更快的训练收敛。大量实验验证了我们的方法在为新发疫情及其他疾病提供更准确预测方面的有效性。代码已公开于 https://github.com/wang1yuhang/domain_invariant_network。
引用
@article{arxiv.2310.07799,
title = {Domain-invariant Clinical Representation Learning by Bridging Data Distribution Shift across EMR Datasets},
author = {Zhongji Zhang and Yuhang Wang and Yinghao Zhu and Xinyu Ma and Yasha Wang and Junyi Gao and Liantao Ma and Wen Tang and Xiaoyun Zhang and Ling Wang},
journal= {arXiv preprint arXiv:2310.07799},
year = {2025}
}