中文

广义零样本 ICD 编码

计算与语言 2019-10-01 v1 机器学习

摘要

国际疾病分类(ICD)是一份用于诊断的分类代码列表。由于人工编码可能费力且易出错,自动 ICD 编码需求很高。这是一项具有极长尾标签分布的多标签文本分类任务,使得难以同时对高频和零样本代码进行细粒度分类。在本文中,我们提出了一种用于广义零样本 ICD 编码的潜特征生成框架,旨在改善对无标注数据代码的预测,同时不损害对已见代码的性能。我们的框架以 ICD 代码描述为条件生成伪特征,并利用 ICD 代码的层次结构。为保证生成特征与真实特征之间的语义一致性,我们重构输入文档中与所条件化 ICD 代码相关的关键词。据我们所知,本工作是首个针对多标签文本分类的广义零样本学习提出对抗生成模型的工作。大量实验证明了我们方法的有效性。在公开 MIMIC-III 数据集上,我们的方法将零样本代码的 F1 分数从接近 0 提升至 20.91%,并将 AUC 分数较先前最优水平绝对提升 3%。我们还展示了该框架提升了少样本代码的性能。

关键词

引用

@article{arxiv.1909.13154,
  title  = {Generalized Zero-shot ICD Coding},
  author = {Congzheng Song and Shanghang Zhang and Najmeh Sadoughi and Pengtao Xie and Eric Xing},
  journal= {arXiv preprint arXiv:1909.13154},
  year   = {2019}
}