Read, Attend, and Code:以机器推动从临床笔记预测医疗编码的极限
计算与语言
2021-07-23 v1 机器学习
摘要
从临床笔记预测医疗编码是当前医疗体系中每个医疗服务机构的实际且关键需求。自动化标注将节省人工编码员今日所耗的大量时间与精力。然而,最大挑战是从非结构化自由文本临床笔记中,直接从数千个高维编码里识别合适医疗编码。过去三年,借助卷积神经网络(CNN)与长短期记忆(LSTM)网络,在 MIMIC-III 全标签住院临床笔记数据集这一最具挑战的基准上取得巨大进展。这引发基本问题:自动化机器学习(ML)系统距人工编码员工作表现还有多远。我们在同一子采样测试集上评估了人工编码员表现基线。我们还提出 Read, Attend, and Code(RAC)模型以学习医疗编码分配映射。通过连接卷积嵌入与自注意力及编码标题引导注意力模块,结合基于句子置换的数据增强与随机权重平均训练,RAC 确立了新的 SOTA,以 18.7% 大幅超越当前最佳 Macro-F1,并越过人工水平编码基线。这一里程碑标志着机器在全自主医疗编码(AMC)上迈向与人类编码员表现持平的有意义一步。
引用
@article{arxiv.2107.10650,
title = {Read, Attend, and Code: Pushing the Limits of Medical Codes Prediction from Clinical Notes by Machines},
author = {Byung-Hak Kim and Varun Ganapathi},
journal= {arXiv preprint arXiv:2107.10650},
year = {2021}
}
备注
To appear in Proceedings of Machine Learning Research, Volume 149: Machine Learning for Healthcare Conference (MLHC), Virtual, August 6-7, 2021