中文

用于自动化 ICD 编码的多模态机器学习

机器学习 2022-09-02 v4 机器学习

摘要

本研究提出一种多模态机器学习模型以预测 ICD-10 诊断编码。我们开发了可分别处理来自不同模态数据的机器学习模型,包括非结构化文本、半结构化文本和结构化表格数据。我们进一步采用集成方法整合所有模态特定模型以生成 ICD-10 编码。我们还提取了关键证据,使预测更具说服力和可解释性。我们使用重症监护医学信息集市 III(MIMIC-III)数据集来验证我们的方法。在 ICD 编码预测方面,我们性能最佳的模型(micro-F1 = 0.7633,micro-AUC = 0.9541)显著优于其他基线模型,包括 TF-IDF(micro-F1 = 0.6721,micro-AUC = 0.7879)和 Text-CNN 模型(micro-F1 = 0.6569,micro-AUC = 0.9235)。在可解释性方面,我们的方法在文本数据上达到 Jaccard 相似系数(JSC)0.1806,在表格数据上达到 0.3105,而训练有素的医师分别达到 0.2780 和 0.5002。

关键词

引用

@article{arxiv.1810.13348,
  title  = {Multimodal Machine Learning for Automated ICD Coding},
  author = {Keyang Xu and Mike Lam and Jingzhi Pang and Xin Gao and Charlotte Band and Piyush Mathur and Frank Papay and Ashish K. Khanna and Jacek B. Cywinski and Kamal Maheshwari and Pengtao Xie and Eric Xing},
  journal= {arXiv preprint arXiv:1810.13348},
  year   = {2022}
}

备注

Machine Learning for Healthcare 2019