基于 BERT 语言模型的标注医学影像报告新语料库及信息抽取结果
计算与语言
2024-03-29 v1
摘要
医学影像对于许多健康状况的诊断、监测和治疗至关重要,包括肿瘤、神经、心血管和肌肉骨骼疾病等。放射科医生解读这些复杂的、非结构化的图像,并通过很大程度上仍是非结构化的叙述性报告表达他们的评估。这种非结构化叙述必须转化为结构化的语义表示,以促进回顾性分析或临床决策支持等二次应用。在此,我们引入了标注医学影像报告语料库(CAMIR),其中包含来自三种成像模态类型的 609 份标注放射学报告:计算机断层扫描、磁共振成像以及正电子发射断层扫描-计算机断层扫描。报告使用基于事件的模式进行标注,捕获临床适应症、病变和医疗问题。每个事件由一个触发词和多个论元组成,且大多数论元类型(包括解剖结构)将文本跨度标准化为预定义概念,以促进二次使用。CAMIR 独特地结合了细粒度的事件结构和概念标准化。为了抽取 CAMIR 事件,我们探索了两种基于 BERT(Bi-directional Encoder Representation from Transformers)的架构,包括一种联合抽取所有事件信息的现有架构(mSpERT),以及一种我们针对 CAMIR 模式进行扩展的多步方法(PL-Marker++)。
引用
@article{arxiv.2403.18975,
title = {A Novel Corpus of Annotated Medical Imaging Reports and Information Extraction Results Using BERT-based Language Models},
author = {Namu Park and Kevin Lybarger and Giridhar Kaushik Ramachandran and Spencer Lewis and Aashka Damani and Ozlem Uzuner and Martin Gunn and Meliha Yetisgen},
journal= {arXiv preprint arXiv:2403.18975},
year = {2024}
}
备注
Accepted at LREC-COLING 2024