中文

重新发现 CNN 对原始电子健康记录基于文本编码的通用性

机器学习 2023-05-11 v2 计算与语言

摘要

充分利用电子健康记录(EHR)中的丰富信息正迅速成为医疗领域的重要课题。近期工作提出了一种有前景的框架,可将原始 EHR 数据中的整体特征嵌入,而不论其形式与医疗代码标准。然而,该框架仅关注以最小预处理编码 EHR,未考虑如何在计算与内存使用方面学习高效的 EHR 表征。本文中,我们寻找一种通用编码器,不仅将大数据缩减至可管理规模,还良好保留患者核心信息以执行多样临床任务。我们发现层次化结构的卷积神经网络(CNN)常在重构、预测与生成等多样任务上优于最先进模型,即便参更少且训练时间更短。此外,利用 EHR 数据固有层次结构可提升任何骨干模型与所执行临床任务的性能。通过大量实验,我们给出将研究发现推广至真实世界实践的具体证据。基于探索众多设置中所捕获的研究发现,我们给出了构建编码器的明确指南。

关键词

引用

@article{arxiv.2303.08290,
  title  = {Rediscovery of CNN's Versatility for Text-based Encoding of Raw Electronic Health Records},
  author = {Eunbyeol Cho and Min Jae Lee and Kyunghoon Hur and Jiyoun Kim and Jinsung Yoon and Edward Choi},
  journal= {arXiv preprint arXiv:2303.08290},
  year   = {2023}
}

备注

Accepted to CHIL 2023