中文

噪声存在下的监督学习:在 ICD-10 编码分类中的应用

机器学习 2021-03-16 v1 人工智能 计算与语言

摘要

ICD 编码是捕获和报告健康状况及诊断以用于医疗收入周期管理的国际标准。由于庞大的代码词表和代码之间的相似性,手动分配 ICD 代码容易出现人为错误。由于基于机器学习的方法需要真值训练数据,人工编码员之间的不一致表现为标注噪声,这使得在此类噪声存在下 ICD 分类器的训练和评估变得困难。本文研究了手动分配的 ICD-10 代码中此类噪声的特征,并进一步提出了一种在标注噪声存在下训练鲁棒 ICD-10 分类器的方法。我们的研究得出结论:此类噪声的性质是系统性的。现有处理标签噪声的方法大多假设噪声完全随机且独立于特征或标签,而 ICD 数据并非如此。因此,我们开发了一种在系统性噪声存在下训练鲁棒分类器的新方法。我们首先基于代码在 ICD-10 层级中的位置、代码类型以及基线分类器的预测行为,识别人工编码员倾向于误用或混淆的 ICD-10 代码;然后我们开发了一种考虑此类噪声的新训练策略。我们将我们的方法与不处理标签噪声的基线以及假设随机噪声的基线方法进行比较,并证明当在专家验证标签上评估时,我们提出的方法优于所有基线。

关键词

引用

@article{arxiv.2103.07808,
  title  = {Supervised Learning in the Presence of Noise: Application in ICD-10 Code Classification},
  author = {Youngwoo Kim and Cheng Li and Bingyang Ye and Amir Tahmasebi and Javed Aslam},
  journal= {arXiv preprint arXiv:2103.07808},
  year   = {2021}
}