正则表达式检测与依存句法分析用于德语医疗文档否定提取的优劣案例研究(技术报告)
计算与语言
2021-05-21 v1
摘要
我们描述了在德语医疗文档中进行信息抽取的工作,特别是使用基于UIMA流水线的架构检测否定。基于我们先前覆盖诊断和检查等医学概念的软件模块工作,我们采用带有大量触发词的NegEx正则表达式算法版本作为基线。我们展示了仅需显著更小的触发词集即可取得相似结果,从而减少对新文本类型的适配时间。我们详述了依存句法分析(基于Stanford CoreNLP模型)是否是一种良好替代方案的问题,并描述了两种方法的潜力与不足。
引用
@article{arxiv.2105.09702,
title = {A Case Study on Pros and Cons of Regular Expression Detection and Dependency Parsing for Negation Extraction from German Medical Documents. Technical Report},
author = {Hans-Jürgen Profitlich and Daniel Sonntag},
journal= {arXiv preprint arXiv:2105.09702},
year = {2021}
}
备注
30 pages