MKE-Coder:基于多轴知识与证据验证的中文电子病历 ICD 编码
摘要
自动编码国际疾病分类 (ICD) 的任务在医疗领域已经得到充分 established 并受到广泛关注。在医疗领域对 ICD 进行自动编码在英语语境中取得了成功,但在处理中文电子病历 (EMR) 时面临挑战。第一个问题在于,由于中文 EMR 书写简洁且结构特定,难以从中提取与疾病代码相关的information。第二个问题是,先前的方法未能利用基于疾病的多轴知识,以及缺乏与相应临床证据的关联。本文介绍了一种新型框架,称为 MKE-Coder:基于多轴知识与证据验证的中文电子病历 ICD 编码。初始时,我们为诊断识别候选代码并将其分类到四个编码轴下的知识中。随后,我们从 EMR 的综合内容中检索相应的临床证据,并通过评分模型筛选可信证据。最后,为了确保候选代码的有效性,我们提出了一个基于掩码语言模型策略的推理模块。该模块验证所有与候选代码相关的轴知识是否由证据支持并提供建议。为评估 our 框架的性能,我们使用一个来自不同医院收集的大型中文 EMR 数据集进行实验。实验结果表明,MKE-Coder 在基于中文 EMR 的自动 ICD 编码任务中表现出显著优势。在 our 方法在模拟真实编码情景下的实际评估中,证明了该方法在显著提升编码者的编码准确性和速度方面具有显著作用。
引用
@article{arxiv.2502.14916,
title = {MKE-Coder: Multi-Axial Knowledge with Evidence Verification in ICD Coding for Chinese EMRs},
author = {Xinxin You and Xien Liu and Xue Yang and Ziyi Wang and Ji Wu},
journal= {arXiv preprint arXiv:2502.14916},
year = {2026}
}
备注
We identified an error in the data preprocessing script that led to inconsistent results in the tables. As the current version contains inaccurate data, we are withdrawing it for further correction and verification