中文

基于多模态电子健康记录数据利用Transformer进行双向表示学习以预测抑郁症

机器学习 2021-03-24 v4

摘要

机器学习算法的进步对利用电子健康记录(EHR)数据构建的表示学习、分类和预测模型产生了有益影响。研究工作一方面致力于提升模型的整体性能,另一方面也着眼于改善其可解释性,尤其是在决策过程方面。在本研究中,我们提出一种时序深度学习模型,采用Transformer架构对EHR序列进行双向表示学习,以预测未来的抑郁症诊断。该模型能够聚合来自EHR的五种异构高维数据源,并以时序方式处理这些数据,从而在多个预测窗口下实现慢性病预测。我们将当前流行的预训练与微调趋势应用于EHR数据,在慢性病预测上超越了当前最先进水平(state-of-the-art),并揭示了序列中EHR代码之间的潜在关联。与最佳基线模型相比,该模型在抑郁症预测中的精确率-召回率曲线下面积(PRAUC)提升最高,从0.70增至0.76。此外,各序列中的自注意力权重定量展示了不同代码之间的内在关系,从而提升了模型的可解释性。这些结果表明,该模型能够利用异构EHR数据预测抑郁症,同时实现高精度与可解释性,这有望在未来促进面向慢性病筛查与早期检测的临床决策支持系统的构建。

关键词

引用

@article{arxiv.2009.12656,
  title  = {Bidirectional Representation Learning from Transformers using Multimodal Electronic Health Record Data to Predict Depression},
  author = {Yiwen Meng and William Speier and Michael K. Ong and Corey W. Arnold},
  journal= {arXiv preprint arXiv:2009.12656},
  year   = {2021}
}

备注

in IEEE Journal of Biomedical and Health Informatics (2021)