中文

利用 Fog 指数从生物医学文本中提取关联概念

计算与语言 2013-08-02 v1 信息检索

摘要

本文确立 Fog 指数 (FI) 作为一种文本过滤器,用于定位包含感兴趣关联生物医学概念的句子。为此,我们使用了 24 篇随机论文,每篇包含四对关联概念。对于每一对概念,我们将句子分类为包含两个概念、任一概念或不包含任何概念。随后,我们利用 FI 衡量各类别句子的难度,发现同时包含两个概念的句子可读性较低。我们根据 FI 对文本中的句子进行排序,并选取难度最高的 30% 的句子。我们使用关联矩阵追踪其中出现频率最高的概念对。该矩阵显示,第一级过滤器产生了一些几乎没有任何关联的概念对。为了去除这些不需要的概念对,我们使用其阳性预测值 (PPV) 和灵敏度 (Sensitivity) 的等权调和平均数作为第二级过滤器。实验结果证明了该方法的有效性。

关键词

引用

@article{arxiv.1307.8057,
  title  = {Extracting Connected Concepts from Biomedical Texts using Fog Index},
  author = {Rushdi Shams and Robert E. Mercer},
  journal= {arXiv preprint arXiv:1307.8057},
  year   = {2013}
}

备注

12th Conference of the Pacific Association for Computational Linguistics (PACLING 2011), Kuala Lumpur, Malaysia, July 19-21, 2011