从词性标注到依存解析:面向生物医学事件抽取
计算与语言
2019-02-13 v2
摘要
背景:鉴于从生物医学研究论文中抽取关系或事件对知识捕获与综合的支持作用,以及此类信息抽取任务对句法信息的强烈依赖,理解哪些生物医学文本句法处理方法具有最高性能是有价值的。结果:我们在两个基准生物医学语料库 GENIA 和 CRAFT 上,对词性(POS)标注和依存解析这两项核心自然语言处理任务的最先进传统基于特征模型与基于神经网络模型进行了实证研究。据我们所知,在生物医学语境下尚无近期工作作此类比较;具体而言,关于神经网络模型在该数据上的详细分析尚属空白。实验结果表明,总体上神经网络模型在两个基准生物医学语料库 GENIA 和 CRAFT 上优于基于特征的模型。我们还进行了面向任务的评估,以探究这些模型在生物医学事件抽取下游应用中的影响,并表明更好的内在解析性能并不总意味着更好的外在事件抽取性能。结论:我们呈现了一项详细的实证研究,比较了生物医学语境下传统基于特征与基于神经网络的 POS 标注和依存解析模型,并探究了为生物医学事件抽取下游任务选择解析器的影响。数据与材料可用性:我们将重训练模型发布于 https://github.com/datquocnguyen/BioPosDep
引用
@article{arxiv.1808.03731,
title = {From POS tagging to dependency parsing for biomedical event extraction},
author = {Dat Quoc Nguyen and Karin Verspoor},
journal= {arXiv preprint arXiv:1808.03731},
year = {2019}
}
备注
Accepted for publication in BMC Bioinformatics