中文

一种从生物医学文献表格中抽取信息的框架

计算与语言 2019-02-27 v1 计算机视觉与模式识别 机器学习

摘要

科学文献正呈指数级增长,专业人员已无法应对当前的出版物数量。文本挖掘在过去提供了从文本中检索和抽取信息的方法;然而,这些方法大多忽略了表格与图形。针对表格数据挖掘的研究仍缺乏一种综合考虑表格所有复杂性与挑战的集成挖掘方法。我们的研究考察了从临床文献表格中抽取数值(患者数量、年龄、性别分布)和文本(不良反应)信息的方法。我们提出了一个需求分析模板以及一种用于临床领域表格信息抽取的完整方法,包含 7 个步骤:(1) 表格检测,(2) 功能处理,(3) 结构处理,(4) 语义标注,(5) 语用处理,(6) 单元格选择以及 (7) 句法处理与抽取。根据变量、任务及其复杂度的不同,我们的方法取得的 F 值介于 82% 到 92% 之间。

关键词

引用

@article{arxiv.1902.10031,
  title  = {A framework for information extraction from tables in biomedical literature},
  author = {Nikola Milosevic and Cassie Gregson and Robert Hernandez and Goran Nenadic},
  journal= {arXiv preprint arXiv:1902.10031},
  year   = {2019}
}

备注

24 pages