中文

基于提示的机器阅读理解的临床概念与关系抽取

计算与语言 2023-07-07 v1

摘要

目的:开发自然语言处理系统,以统一的基于提示的机器阅读理解(MRC)架构解决临床概念抽取与关系抽取,并具备跨机构应用的良好泛化性。方法:我们使用统一的基于提示的 MRC 架构表述临床概念抽取与关系抽取,并探索最先进的 transformer 模型。我们使用 2018 年国家 NLP 临床挑战赛(n2c2)(药物与不良药物事件)与 2022 年 n2c2 挑战赛(健康社会决定因素 [SDoH] 关系)构建的两个基准数据集,将我们的 MRC 模型与现有的深度学习概念抽取与端到端关系抽取模型比较。我们还评估了所提 MRC 模型在跨机构设定下的迁移学习能力。我们进行错误分析并考察不同提示策略如何影响 MRC 模型性能。结果与结论:所提 MRC 模型在两个基准数据集上取得临床概念与关系抽取的 SOTA 性能,优于以往非 MRC 的 transformer 模型。GatorTron-MRC 在概念抽取上取得最佳严格与宽松 F1 分数,分别在两个数据集上优于以往深度学习模型 1%~3% 与 0.7%~1.3%。对于端到端关系抽取,GatorTron-MRC 与 BERT-MIMIC-MRC 取得最佳 F1 分数,分别优于以往深度学习模型 0.9%~2.4% 与 10%–11%。在跨机构评估中,GatorTron-MRC 在两个数据集上分别优于传统 GatorTron 6.4% 与 16%。所提方法更擅长处理嵌套/重叠概念、抽取关系,并对跨机构应用具备良好可移植性。

关键词

引用

@article{arxiv.2303.08262,
  title  = {Clinical Concept and Relation Extraction Using Prompt-based Machine Reading Comprehension},
  author = {Cheng Peng and Xi Yang and Zehao Yu and Jiang Bian and William R. Hogan and Yonghui Wu},
  journal= {arXiv preprint arXiv:2303.08262},
  year   = {2023}
}