中文

MIMIC-III 与 MIMIC-IV 上的自动化医疗编码:批判性综述与可复现性研究

机器学习 2023-04-24 v1 信息检索

摘要

医疗编码是将医疗代码分配给临床自由文本文档的任务。医疗专业人员手动分配此类代码以追踪患者诊断和治疗。自动化医疗编码可显著减轻这一行政负担。在本文中,我们复现、比较并分析了最先进的自动化医疗编码机器学习模型。我们表明,若干模型由于弱配置、采样不佳的训练-测试划分以及不充分的评估而表现不佳。在先前工作中,宏 F1 分数(macro F1 score)的计算并非最优,而我们的修正使其翻倍。我们贡献了使用分层采样和相同实验设置(包括超参数和决策边界调优)的修订模型比较。我们分析预测错误以验证并证伪先前工作的假设。该分析证实所有模型都难以处理罕见代码,而长文档仅具有可忽略的影响。最后,我们使用复现的模型在 newly released 的 MIMIC-IV 数据集上呈现首个全面结果。我们发布我们的代码、模型参数以及新的 MIMIC-III 和 MIMIC-IV 训练和评估流程,以便未来公平的比较。

关键词

引用

@article{arxiv.2304.10909,
  title  = {Automated Medical Coding on MIMIC-III and MIMIC-IV: A Critical Review and Replicability Study},
  author = {Joakim Edin and Alexander Junge and Jakob D. Havtorn and Lasse Borgholt and Maria Maistro and Tuukka Ruotsalo and Lars Maaløe},
  journal= {arXiv preprint arXiv:2304.10909},
  year   = {2023}
}

备注

11 pages, 6 figures, to be published in Proceedings of the 46th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '23), July 23--27, 2023, Taipei, Taiwan