中文

基于树对比学习的半结构化自动 ICD 编码

机器学习 2023-10-17 v1

摘要

国际疾病分类(ICD)自动编码是一项多标签文本分类任务,涉及从临床记录中提取疾病或操作码。尽管最先进的自然语言处理(NLP)技术已得到应用,仍存在诸多挑战,包括因隐私限制导致的数据可用性有限,以及由医务人员不同书写习惯和患者多样病理特征引起的临床记录高变异性。本工作中,我们探究临床记录的半结构化特性,并提出一种将其分段为章节的自动算法。为解决现有 ICD 编码模型在有限数据下的变异性问题,我们引入一种基于树编辑距离的软多标签相似度度量在章节上的对比预训练方法。此外,我们设计了一种掩码章节训练策略,使 ICD 编码模型能够定位与 ICD 码相关的章节。大量实验结果证明,我们提出的训练策略有效提升了现有 ICD 编码方法的性能。

关键词

引用

@article{arxiv.2310.09672,
  title  = {Towards Semi-Structured Automatic ICD Coding via Tree-based Contrastive Learning},
  author = {Chang Lu and Chandan K. Reddy and Ping Wang and Yue Ning},
  journal= {arXiv preprint arXiv:2310.09672},
  year   = {2023}
}

备注

Accepted by NeurIPS 2023