中文

探索用于生物医学关系抽取的半监督变分自编码器

计算与语言 2019-01-21 v1

摘要

生物医学文献提供了丰富的知识来源,如蛋白质-蛋白质相互作用(PPIs)、药物-药物相互作用(DDIs)和化学-蛋白质相互作用(CPIs)。生物医学关系抽取旨在从生物医学文本中自动提取生物医学关系,以服务于各类生物医学研究。当前最先进(SOTA)的生物医学关系抽取方法主要基于监督式机器学习,因此依赖于(充足的)标注数据。然而,创建大规模训练数据极其昂贵且耗费人力,尤其在生物医学领域,因为这需要领域知识。相比之下,PubMed 中存在大量未标注的生物医学文本。因此,能够利用未标注数据以减轻人工标注负担的计算方法在生物医学关系抽取中尤为引人关注。我们提出了一种基于变分自编码器(VAE)的用于生物医学关系抽取的新型半监督方法。我们的模型由以下三部分组成:分类器、编码器和解码器。分类器使用多层卷积神经网络(CNNs)实现,编码器和解码器分别使用双向长短期记忆网络(Bi-LSTMs)和 CNNs 实现。该半监督机制使我们的模型能够从标注数据和未标注数据中学习特征。我们在多个公开的 PPI、DDI 和 CPI 语料库上评估了我们的方法。实验结果表明,我们的方法有效利用了未标注数据来提升性能并降低对标注数据的依赖。据我们所知,这是首个基于半监督 VAE 的(生物医学)关系抽取方法。我们的结果表明,利用此类未标注数据可极大有益于提升各类生物医学关系抽取的性能。

关键词

引用

@article{arxiv.1901.06103,
  title  = {Exploring Semi-supervised Variational Autoencoders for Biomedical Relation Extraction},
  author = {Yijia Zhang and Zhiyong Lu},
  journal= {arXiv preprint arXiv:1901.06103},
  year   = {2019}
}

备注

13 pages, 4 figures