利用关系抽取进行更深层的临床文档理解
计算与语言
2021-12-28 v1 人工智能
机器学习
摘要
生物医学文献与数字临床记录的激增,使得对文本挖掘技术的需求不断增长,这些技术不仅能识别非结构化数据中的实体,还能在语义上关联它们。本文提出一个由命名实体识别(NER)与关系抽取(RE)模型组成的文本挖掘框架,在先前工作基础上从三方面拓展。第一,我们引入两种新的 RE 模型架构——一种基于 BioBERT 的精度优化架构,以及一种在全连接神经网络(FCNN)上利用人工特征的速度优化架构。第二,我们在公开基准数据集上评估两种模型,并在 2012 i2b2 临床时间关系挑战赛(F1 为 73.6,较先前 SOTA 提升 1.2%)、2010 i2b2 临床关系挑战赛(F1 为 69.1,+1.2%)、2019 表型-基因关系数据集(F1 为 87.9,+8.5%)、2012 不良药物事件-药物反应数据集(F1 为 90.0,+6.3%)和 2018 n2c2 给药关系数据集(F1 为 96.7,+0.6%)上取得新的最优 F1 分数。第三,我们展示了该框架的两个实际应用——构建生物医学知识图谱与提升实体到临床编码映射的准确率。该系统使用 Spark NLP 库构建,其提供了一个生产级、原生可扩展、硬件优化、可训练可调优的 NLP 框架。
引用
@article{arxiv.2112.13259,
title = {Deeper Clinical Document Understanding Using Relation Extraction},
author = {Hasham Ul Haq and Veysel Kocaman and David Talby},
journal= {arXiv preprint arXiv:2112.13259},
year = {2021}
}
备注
Accepted to SDU (Scientific Document Understanding) workshop at AAAI 2022