中文

用于概念识别的并行序列标注

计算与语言 2020-08-11 v2 信息检索 机器学习

摘要

背景:命名实体识别(NER)与规范化(NEN)是任意生物医学文本挖掘系统的核心组件。在传统概念识别流水线中,这些任务以串行方式组合,天然易产生从 NER 到 NEN 的错误传播。我们提出一种并行架构,将 NER 与 NEN 均建模为序列标注任务,直接作用于源文本。我们考察了将两类分类器预测合并为单一输出序列的不同协调策略。结果:我们在 CRAFT 语料库近期第 4 版上测试该方法。在概念标注任务的全部 20 个标注集中,我们的系统优于 CRAFT 2019 共享任务中作为基线的流水线系统。结论:分析表明两类分类器的优势可富有成效地结合。然而,预测协调需针对每个标注集在开发集上单独校准,从而在既有知识(训练集)与新信息(未见概念)间取得良好权衡。可用性与实现:源代码可自由下载于 https://github.com/OntoGene/craft-st。补充数据见于 arXiv 在线。

关键词

引用

@article{arxiv.2003.07424,
  title  = {Parallel sequence tagging for concept recognition},
  author = {Lenz Furrer and Joseph Cornelius and Fabio Rinaldi},
  journal= {arXiv preprint arXiv:2003.07424},
  year   = {2020}
}

备注

14 pages, 5 figures; style changed, sections reordered, minor additions suggested by reviewers