中文

迈向基于 BERT 的自动 ICD 编码:局限与机遇

计算与语言 2021-04-15 v1 人工智能

摘要

自动 ICD 编码是将国际疾病分类(ICD)中的代码分配给医疗记录的任务。这些代码描述患者状态并具有多种应用,例如计算机辅助诊断或流行病学研究。由于医疗记录的复杂性与长度,ICD 编码是一项具有挑战性的任务。与语言处理的普遍趋势不同,尚无报道表明任何 transformer 模型在该任务上达到高性能。在此,我们详细研究了使用 PubMedBERT(一种用于生物医学语言理解的先进 transformer 模型)进行 ICD 编码。我们发现,在长文本上微调模型的困难是基于 BERT 的模型用于 ICD 编码的主要局限。我们进行了大量实验并表明,尽管与当前最优水平存在差距,预训练 transformer 在使用相对少量的文本时即可达到有竞争力的性能。我们指出,更好地聚合长文本信息的方法是改进基于 BERT 的 ICD 编码的主要需求。

关键词

引用

@article{arxiv.2104.06709,
  title  = {Towards BERT-based Automatic ICD Coding: Limitations and Opportunities},
  author = {Damian Pascual and Sandro Luck and Roger Wattenhofer},
  journal= {arXiv preprint arXiv:2104.06709},
  year   = {2021}
}

备注

Accepted at BioNLP 2021