中文

语义分解改进大语言模型在电子健康记录数据上的学习

计算与语言 2022-12-13 v1 机器学习

摘要

电子健康记录(EHR)被广泛认为蕴含大量可操作的洞察,这些信息以不规则、半结构化的格式加密在强烈的噪声背景中。为简化健康与疾病模式的学习,EHR中的医学编码可被分解为由层次图连接的语义单元。基于早前 Bidirectional Encoder Representations from Transformers(BERT)与 Graph Attention Networks(GAT)的协同作用,我们提出 H-BERT,其摄入层次化医学编码的完整图树展开(而非仅摄入叶节点),并将患者级标签下推至每次就诊。该方法显著提升了在超过 500 个医学诊断类别上患者归属的预测效果(以聚合 AUC 和 APS 衡量),并为临床相关但表型不同的患者创建了差异化表示。

关键词

引用

@article{arxiv.2212.06040,
  title  = {Semantic Decomposition Improves Learning of Large Language Models on EHR Data},
  author = {David A. Bloore and Romane Gauriau and Anna L. Decker and Jacob Oppenheim},
  journal= {arXiv preprint arXiv:2212.06040},
  year   = {2022}
}

备注

Extended Abstract presented at Machine Learning for Health (ML4H) symposium 2022, November 28th, 2022, New Orleans, United States & Virtual, http://www.ml4h.cc, 9 pages