基于依存树模式的医学文献信息性因果抽取
计算与语言
2022-03-15 v1 机器学习
摘要
从医学文献中抽取因果实体是医学信息检索中的一项重要任务。解决该任务的方案可用于编纂各种因果关系,例如疾病与症状之间、药物与副作用之间、基因与疾病之间的因果关系等。现有的因果实体抽取方案在原因与结果短语为命名实体、单词名词或由两到三个词组成的名词短语的句子上表现良好。遗憾的是,在医学文献中,句子中的原因和结果短语并非简单的名词或名词短语,而是由多个词组成的复杂短语,现有方法无法在此类句子中正确抽取因果实体。相较于原句本意,因果实体的部分抽取会传达质量差、无信息量且常相矛盾的事实。本工作中,我们通过设计一种专为医学文献定制的无监督因果短语抽取方法 PatternCausality 来解决此问题。我们提出的方法首先使用一组因果依存模式作为模板抽取因果短语的中心词,然后利用一种新颖的短语抽取方法从句子中获得完整且有意义的因果短语。在基于 PubMed 文章句子构建的因果数据集上的实验表明,在抽取因果实体方面,PatternCausality 显著优于现有方法,其 F 值指标相较最佳现有方法有数量级的提升。
引用
@article{arxiv.2203.06592,
title = {Informative Causality Extraction from Medical Literature via Dependency-tree based Patterns},
author = {Md. Ahsanul Kabir and AlJohara Almulhim and Xiao Luo and Mohammad Al Hasan},
journal= {arXiv preprint arXiv:2203.06592},
year = {2022}
}
备注
22 pages without comment