中文

利用神经网络蒸馏与变量选择识别心力衰竭发病的风险因素

机器学习 2021-03-02 v2

摘要

近期证据表明,在数百万患者的电子健康记录上训练得到的深度学习模型,相比统计对应方法能够大幅更准确地预测风险。尽管这为改进临床决策提供了重要机遇,但缺乏可解释性是这些黑盒模型纳入常规医疗的主要障碍,限制了其可信度并阻碍了进一步的假设检验研究。在本研究中,我们提出两种方法,即模型蒸馏与变量选择,以揭示一个已建立的深度学习模型(BEHRT)为风险关联识别所学到的隐藏模式。由于心力衰竭作为一种表型在临床上的重要性与多样性,我们以其为例展示所提方法的优势。本研究考虑了一个包含 788,880 名患者(8.3% 为心力衰竭发病)的队列。模型蒸馏在群体水平上分别识别出 598 种和 379 种与心力衰竭相关和无关的疾病。虽然这些关联与既有知识大体一致,我们的方法也突出了若干值得进一步研究的鲜被重视的关联。除这些重要的群体水平洞见外,我们开发了个体水平解释方法,以考虑临床实践中心力衰竭表现的差异性。这通过变量选择实现,即检测一组最小的就诊记录,以在个体上最大程度保持预测准确性。我们提出的工作提供了一种从数据驱动视角在群体与个体水平识别风险因素的赋能发现工具。这有助于产生新假设并指导对因果关联的进一步研究。

关键词

引用

@article{arxiv.2102.12936,
  title  = {Risk factor identification for incident heart failure using neural network distillation and variable selection},
  author = {Yikuan Li and Shishir Rao and Mohammad Mamouei and Gholamreza Salimi-Khorshidi and Dexter Canoy and Abdelaali Hassaine and Thomas Lukasiewicz and Kazem Rahimi},
  journal= {arXiv preprint arXiv:2102.12936},
  year   = {2021}
}