中文

面向癌症患者计算表型与死亡预测的约束张量分解

机器学习 2021-12-28 v1

摘要

背景:电子健康记录(EHR)在美国的日益普及产生了大量可计算数据,机器学习方法已被应用于从中提取有用见解。EHR 数据表示为矩阵的三维类比(张量),被分解为可解释为计算表型的二维因子。方法:我们应用约束张量分解,在 2000 年至 2015 年西北医学企业数据仓库中乳腺癌、前列腺癌、结直肠癌或肺癌患者队列中推导计算表型并预测死亡。在实验中,我们考察了在分解算法中使用监督项、按医学适应症过滤张量共现,以及在分解过程中纳入额外的健康社会决定因素(SDOH)协变量。我们通过定性评估以及使用曲线下面积(AUC)统计量评估其预测五年死亡率的能力来评价所得计算表型。结果:按医学适应症过滤得到了更简洁且可解释的表型。死亡预测性能(AUC)在不同实验条件和癌症类型下有所变化(乳腺:0.623 - 0.694,前列腺:0.603 - 0.750,结直肠:0.523 - 0.641,肺:0.517 - 0.623)。一般而言,使用监督项和纳入 SDOH 协变量可改善预测性能。结论:约束张量分解应用于癌症患者的稀疏 EHR 数据,可发现预测五年死亡率的计算表型。将 SDOH 变量纳入分解算法是一种易于实现且有效的提升预测性能的方法。

关键词

引用

@article{arxiv.2112.12933,
  title  = {Constrained tensor factorization for computational phenotyping and mortality prediction in patients with cancer},
  author = {Francisco Y Cai and Chengsheng Mao and Yuan Luo},
  journal= {arXiv preprint arXiv:2112.12933},
  year   = {2021}
}