中文

半自监督的自动化ICD编码

计算与语言 2022-08-19 v2 机器学习 机器学习

摘要

临床文本记录(CTNs)包含医生在检查和问诊患者时以非结构化自由文本格式写下的推理过程。近年来,若干研究提供了机器学习可从CTNs预测医生诊断(称为ICD编码的任务)之效用的证据。数据标注耗时,尤其在需要一定程度专业性时,正如医疗数据的情况。本文提出一种以半自监督方式用机器学习填补来扩充稀疏标注的冰岛语CTNs数据集的方法。我们在一小部分标注CTNs上训练神经网络,并用它从一组未标注CTNs中提取临床特征。这些临床特征包含约一千个潜在问题的答案,医生可能在患者问诊期间找到这些答案。随后这些特征被用于训练针对某类疾病诊断的分类器。我们报告了在医生数据可用性的三个层级上对该数据扩充方法的评估结果。我们的数据扩充方法显示出显著的积极效果,但当来自患者检查和诊断的临床特征可用时该效果减弱。我们推荐将我们的方法用于扩充稀缺数据集,以构建基于不含检查或检验的临床特征做决策的系统。

关键词

引用

@article{arxiv.2205.10088,
  title  = {Semi-self-supervised Automated ICD Coding},
  author = {Hlynur D. Hlynsson and Steindór Ellertsson and Jón F. Daðason and Emil L. Sigurdsson and Hrafn Loftsson},
  journal= {arXiv preprint arXiv:2205.10088},
  year   = {2022}
}

备注

Re-upload comment: added a baseline comparison as well as an analysis of the features