中文

通过自动弱监督对非结构化临床笔记进行分类

计算与语言 2022-08-03 v2 机器学习

摘要

医疗服务提供者通常为每位患者记录所提供临床诊疗的详细笔记,用于临床、研究和计费目的。由于这些叙述的非结构化性质,提供者雇用专门人员使用国际疾病分类(ICD)编码系统为患者诊断分配诊断码。这一人工过程不仅耗时,而且成本高且易出错。先前的工作展示了机器学习(ML)方法在自动化该过程中的潜在效用,但它依赖于大量人工标注数据来训练模型。此外,诊断编码系统随时间演变,这使得传统监督学习策略无法推广到局部应用之外。在这项工作中,我们引入了一个通用的弱监督文本分类框架,该框架仅从类标签描述中学习,无需使用任何人工标注文档。它利用预训练语言模型中存储的语言领域知识和数据编程框架为单个文本分配码标签。我们通过将本方法与最先进的弱文本分类器在四个真实世界文本分类数据集上进行比较,以及为公开可用的MIMIC-III数据库中的医疗笔记分配ICD码,证明了我们方法的有效性和灵活性。

关键词

引用

@article{arxiv.2206.12088,
  title  = {Classifying Unstructured Clinical Notes via Automatic Weak Supervision},
  author = {Chufan Gao and Mononito Goswami and Jieshi Chen and Artur Dubrawski},
  journal= {arXiv preprint arXiv:2206.12088},
  year   = {2022}
}

备注

18 pages, 3 figures and 6 tables. Accepted at the Machine Learning for Healthcare Conference (MLHC) 2022. Code available at https://github.com/autonlab/KeyClass