中文

BERT-GT:基于 BERT 与图 Transformer 的跨句 n 元关系抽取

计算与语言 2021-01-13 v1

摘要

一条生物医学关系陈述通常表达于多个句子中,并包含诸多概念,如基因、疾病、化学物质与突变。为从生物医学文献中自动提取信息,现有的生物医学文本挖掘方法通常将该问题表述为跨句 n 元关系抽取任务,即检测跨多个句子的 n 个实体间的关系,并使用图神经网络(GNN)结合长短期记忆(LSTM)或注意力机制。近来,Transformer 已被证明在众多自然语言处理(NLP)任务上优于 LSTM。在本工作中,我们提出一种将来自 Transformer 的双向编码器表示(BERT)与图 Transformer(BERT-GT)相结合的新型架构,通过将邻居注意力机制整合进 BERT 架构中。与利用整个句子(或多个句子)计算当前词元注意力的原始 Transformer 架构不同,我们方法中的邻居注意力机制仅利用其邻居词元计算注意力。因此,每个词元能以极少噪声关注其邻居信息。我们表明,在如跨句或摘要级关系抽取任务中文本很长时,这一点至关重要。我们的基准测试结果显示,在 n 元与化学-蛋白质关系数据集上,准确率与 F1 值较最先进水平分别提升 5.44% 与 3.89%,表明 BERT-GT 是一种可应用于其他生物医学关系抽取任务或数据集的鲁棒方法。

关键词

引用

@article{arxiv.2101.04158,
  title  = {BERT-GT: Cross-sentence n-ary relation extraction with BERT and Graph Transformer},
  author = {Po-Ting Lai and Zhiyong Lu},
  journal= {arXiv preprint arXiv:2101.04158},
  year   = {2021}
}

备注

24 pages, 6 figures