中文

基于预训练语言表示与极简任务特定架构的生物医学关系抽取

计算与语言 2019-09-30 v1

摘要

本文介绍了我们参与2019年BioNLP开放共享任务中AGAC赛道的工作。我们为任务3提供了解决方案,该任务旨在抽取“基因-功能变化-疾病”三元组,其中“基因”和“疾病”分别为特定基因和疾病的提及,“功能变化”为四种预定义关系类型之一。我们的系统扩展了BERT (Devlin et al., 2018)——一个最先进的语言模型,它从大型无标注语料中学习上下文语言表示,其参数可通过微调以极少的额外架构解决特定任务。我们将两个提及及其文本上下文作为BERT中的两个连续序列进行编码,以特殊符号分隔。随后我们使用单层线性层将其关系分类为五类(四种预定义类以及“无关系”)。尽管存在显著的类不平衡,我们的系统显著优于随机基线,且仅依赖极其简单的设置,无任何专门设计的特征。

关键词

引用

@article{arxiv.1909.12411,
  title  = {Biomedical relation extraction with pre-trained language representations and minimal task-specific architecture},
  author = {Ashok Thillaisundaram and Theodosia Togia},
  journal= {arXiv preprint arXiv:1909.12411},
  year   = {2019}
}

备注

EMNLP-IJCNLP 2019: International Workshop on BioNLP Open Shared Tasks 2019