中文

从极端多标签到多分类:基于短语级注意力的ICD-10自动编码层次化方法

计算与语言 2022-03-11 v2 人工智能

摘要

临床编码是指根据临床叙述中所捕获的上下文,将一组称为ICD(国际疾病分类)的字母数字代码分配给医疗事件的任务。最新版本的ICD,即ICD-10,包含超过70,000个代码。由于这是一项劳动密集且易出错的任务,过去十年中使用机器学习对医疗报告进行自动ICD编码引起了极大关注。现有文献将该问题建模为多标签任务。然而,由于标签集规模极大,此类多标签方法具有挑战性。此外,预测的可解释性对最终用户(如医疗服务提供者和保险公司)至关重要。在本文中,我们通过将极端多标签问题重构为更简单的多分类问题,采用层次化方案,提出了一种自动ICD编码的新方法。我们通过广泛的数据收集获取短语级人工编码员标注,以监督模型学习输入文本与预测ICD代码之间的特定关系,从而使该方法可行。我们的方法采用两个独立训练的网络——句子标注器和ICD分类器,以层次化堆叠方式预测医疗报告的代码集。句子标注器识别包含与ICD编码相关的医疗事件或概念的焦点句子。ICD分类器利用有监督注意力机制,将每个焦点句子分配一个ICD代码。所提方法在子集准确率上以23%大幅优于强基线,微观F1提升18%,基于实例的F1提升15%。通过我们的方法,可解释性并非通过隐式学习的注意力分数实现,而是通过将每次预测归因于人工编码员选定的特定句子和词语来达成。

关键词

引用

@article{arxiv.2102.09136,
  title  = {From Extreme Multi-label to Multi-class: A Hierarchical Approach for Automated ICD-10 Coding Using Phrase-level Attention},
  author = {Cansu Sen and Bingyang Ye and Javed Aslam and Amir Tahmasebi},
  journal= {arXiv preprint arXiv:2102.09136},
  year   = {2022}
}