中文

基于 Transformer 模型的临床关系抽取

计算与语言 2021-08-17 v2 信息检索 机器学习

摘要

新近出现的 transformer 技术对 NLP 研究产生了巨大影响。在通用英语领域,基于 transformer 的模型已在多项 NLP 基准上取得最先进性能。在临床领域,研究者也探讨了 transformer 模型用于临床应用。本研究的目的是系统探究三种广泛使用的基于 transformer 的模型(即 BERT、RoBERTa 与 XLNet)用于临床关系抽取,并开发一个包含临床预训练 transformer 模型的开源包,以促进临床领域的信息抽取。我们基于 BERT、RoBERTa 与 XLNet 三种 transformer 架构开发了一系列临床关系抽取(RE)模型。我们使用来自 2018 MADE1.0 与 2018 n2c2 挑战赛的两个公开数据集评估这些模型。我们比较了两种分类策略(二分类 vs. 多分类)并探究了不同实验设置下生成候选关系的两种方法。本研究中,我们比较了三种基于 transformer(BERT、RoBERTa 与 XLNet)的关系抽取模型。我们证明 RoBERTa-clinical RE 模型在 2018 MADE1.0 数据集上以 0.8958 的 F1 值取得最佳性能。在 2018 n2c2 数据集上,XLNet-clinical 模型以 0.9610 的 F1 值取得最佳成绩。我们的结果表明,二分类策略在临床关系抽取中始终优于多分类策略。我们的方法与模型公开于 https://github.com/uf-hobi-informatics-lab/ClinicalTransformerRelationExtraction。我们相信本工作将改进当前的临床关系抽取实践及生物医学领域其他相关 NLP 任务。

关键词

引用

@article{arxiv.2107.08957,
  title  = {Clinical Relation Extraction Using Transformer-based Models},
  author = {Xi Yang and Zehao Yu and Yi Guo and Jiang Bian and Yonghui Wu},
  journal= {arXiv preprint arXiv:2107.08957},
  year   = {2021}
}

备注

1 Figure; 29 pages