重新发现 CNN 对原始电子健康记录基于文本编码的通用性
机器学习
2023-05-11 v2 计算与语言
摘要
充分利用电子健康记录(EHR)中的丰富信息正迅速成为医疗领域的重要课题。近期工作提出了一种有前景的框架,可将原始 EHR 数据中的整体特征嵌入,而不论其形式与医疗代码标准。然而,该框架仅关注以最小预处理编码 EHR,未考虑如何在计算与内存使用方面学习高效的 EHR 表征。本文中,我们寻找一种通用编码器,不仅将大数据缩减至可管理规模,还良好保留患者核心信息以执行多样临床任务。我们发现层次化结构的卷积神经网络(CNN)常在重构、预测与生成等多样任务上优于最先进模型,即便参更少且训练时间更短。此外,利用 EHR 数据固有层次结构可提升任何骨干模型与所执行临床任务的性能。通过大量实验,我们给出将研究发现推广至真实世界实践的具体证据。基于探索众多设置中所捕获的研究发现,我们给出了构建编码器的明确指南。
引用
@article{arxiv.2303.08290,
title = {Rediscovery of CNN's Versatility for Text-based Encoding of Raw Electronic Health Records},
author = {Eunbyeol Cho and Min Jae Lee and Kyunghoon Hur and Jiyoun Kim and Jinsung Yoon and Edward Choi},
journal= {arXiv preprint arXiv:2303.08290},
year = {2023}
}
备注
Accepted to CHIL 2023