中文

全摘要生物关系抽取中同时自注意力于所有提及

计算与语言 2018-03-01 v1

摘要

大多数关系抽取工作通过查看包含单一实体对提及的单个句子内短文本跨度来形成预测。这种方法通常不考虑跨提及的交互,对每个提及对需要冗余计算,并忽略跨句子边界表达的关系。生物文本中常见的文档级(而非句子级)标注加剧了这些问题。为此,我们提出一种同时对文档中所有提及对预测关系的模型。我们使用高效的自我注意力编码器在整篇论文摘要上形成成对预测。所有提及对的得分使我们能够通过聚合提及来形成实体对表示,从而进行多实例学习。我们进一步通过联合训练预测命名实体并添加弱标注数据语料,适配于无提及级标注的设定。在两个Biocreative基准数据集上的实验中,我们在无外部KB资源的模型上于Biocreative V化学疾病关系数据集取得了最优性能。我们还引入了一个比现有人工标注生物信息抽取数据集大一个数量级且比远程监督替代方案更准确的新数据集。

关键词

引用

@article{arxiv.1802.10569,
  title  = {Simultaneously Self-Attending to All Mentions for Full-Abstract Biological Relation Extraction},
  author = {Patrick Verga and Emma Strubell and Andrew McCallum},
  journal= {arXiv preprint arXiv:1802.10569},
  year   = {2018}
}

备注

NAACL 2018