基于知识从生物医学文本中抽取因果关系
计算与语言
2021-03-11 v1
摘要
我们提出一种基于知识的方法,用于从生物医学文本中抽取因果(Cause-Effect, CE)关系。我们的方法结合了无监督机器学习技术(用于发现因果触发词)与一组高精度语言规则(用于识别这些因果触发词的因/果论元)。我们使用包含 58,761 篇白血病相关 PubMed 摘要(共 568,528 个句子)的语料库评估了该方法。我们从中抽取出 152,655 个 CE 三元组,每个三元组由原因短语、结果短语和因果触发词组成。与现有知识库 SemMedDB(Kilicoglu 等,2012)相比,抽取数量几乎为其两倍。此外,在 500 个句子的数据集上,所提方法优于现有技术 SemRep(Rindflesch 和 Fiszman,2003)。
引用
@article{arxiv.2103.06078,
title = {Knowledge-based Extraction of Cause-Effect Relations from Biomedical Text},
author = {Sachin Pawar and Ravina More and Girish K. Palshikar and Pushpak Bhattacharyya and Vasudeva Varma},
journal= {arXiv preprint arXiv:2103.06078},
year = {2021}
}