面向医疗文档理解的层次化 BERT
计算与语言
2022-04-21 v1 人工智能
计算机视觉与模式识别
摘要
医疗文档理解近来备受关注。其中一个代表性任务是国际疾病分类(ICD)诊断代码分配。现有工作采用 RNN 或 CNN 作为骨干网络,因为原始 BERT 难以很好地处理长文档(>2000 tokens)。这些方法普遍存在的一个问题是它们过度针对 ICD 代码分配任务,丧失了对整个文档级和句子级嵌入的通用性。因此,直接将它们迁移到其他下游自然语言理解(NLU)任务并不直观。受这些观察的启发,我们提出 Medical Document BERT (MDBERT) 用于长医疗文档理解任务。MDBERT 不仅能在不同语义层次上有效学习表示,还能通过自底向上的层次化架构高效编码长文档。与原始 BERT 方案相比:1, MDBERT 在 MIMIC-III 数据集上将性能相对提升高达 20%,使其与当前 SOTA 方案相当;2, 它将自注意力模块的计算复杂度降低到不足 1/100。除 ICD 代码分配外,我们在一个名为 TrialTrove 的大型商业数据集上进行了多种其他 NLU 任务,以展示 MDBERT 在提供不同层次语义方面的优势。
引用
@article{arxiv.2204.09600,
title = {Hierarchical BERT for Medical Document Understanding},
author = {Ning Zhang and Maciej Jankowski},
journal= {arXiv preprint arXiv:2204.09600},
year = {2022}
}