大规模自动编码:智利公共医疗系统转诊单规范化全国系统的设计与部署
计算与语言
2024-07-29 v1
摘要
疾病编码任务是指为临床文档中提及的每种疾病从受控词表中分配一个唯一标识符。该任务具有重要意义,因为它允许从非结构化数据中提取信息,以开展例如针对特定背景下疾病发病率与患病率的流行病学研究。然而,人工编码过程容易出现错误,因为它要求医务人员熟练掌握编码规则与术语。此外,该过程耗费大量时间与精力,而这些本可投入到更具临床相关性的任务中。这些困难可通过开发自动为疾病分配编码的计算系统来应对。为此,我们提出了一种两步式系统,用于自动编码智利公共医疗系统转诊单中的疾病。具体而言,我们的模型采用最先进的命名实体识别(NER)模型来识别疾病提及,并基于 Elasticsearch 的搜索引擎系统为这些疾病提及分配最相关的编码。系统性能在由临床专家人工编码的转诊单上进行了评估。我们的系统在亚类层级获得了 0.63 的 MAP 分数,在类别层级获得了 0.83 的 MAP 分数,接近文献中性能最佳的模型。该系统可作为卫生专业人员的辅助工具,优化编码与管理流程。最后,为保证可复现性,我们公开发布了模型与实验的代码。
引用
@article{arxiv.2307.05560,
title = {Automatic Coding at Scale: Design and Deployment of a Nationwide System for Normalizing Referrals in the Chilean Public Healthcare System},
author = {Fabián Villena and Matías Rojas and Felipe Arias and Jorge Pacheco and Paulina Vera and Jocelyn Dunstan},
journal= {arXiv preprint arXiv:2307.05560},
year = {2024}
}