中文

BERT-XML:基于BERT预训练的大规模自动化ICD编码

信息检索 2020-06-09 v1 计算与语言 机器学习 机器学习

摘要

临床交互最初以自由文本病历记录与存档。ICD编码的任务是对患者就诊相关的所有诊断、症状及操作进行分类与编码。该过程常由人工完成,对医院而言极为耗时且昂贵。本文中,我们提出一种机器学习模型BERT-XML,用于基于电子健康记录(EHR)病历的大规模自动化ICD编码,其利用了近期发展的无监督预训练——后者已在多种NLP任务上取得最先进(state-of-the-art)性能。我们从零开始在EHR病历上训练BERT模型,学习更适配EHR任务的词表,从而优于开箱即用模型。我们借助多标签注意力将BERT架构适配于ICD编码。其他工作聚焦于小型公共医疗数据集,而我们构建了首个大规模ICD-10分类模型,使用数百万条EHR病历预测数千个唯一ICD代码。

关键词

引用

@article{arxiv.2006.03685,
  title  = {BERT-XML: Large Scale Automated ICD Coding Using BERT Pretraining},
  author = {Zachariah Zhang and Jingshu Liu and Narges Razavian},
  journal= {arXiv preprint arXiv:2006.03685},
  year   = {2020}
}