利用 Fog 指数从生物医学文本中提取关联概念
计算与语言
2013-08-02 v1 信息检索
摘要
本文确立 Fog 指数 (FI) 作为一种文本过滤器,用于定位包含感兴趣关联生物医学概念的句子。为此,我们使用了 24 篇随机论文,每篇包含四对关联概念。对于每一对概念,我们将句子分类为包含两个概念、任一概念或不包含任何概念。随后,我们利用 FI 衡量各类别句子的难度,发现同时包含两个概念的句子可读性较低。我们根据 FI 对文本中的句子进行排序,并选取难度最高的 30% 的句子。我们使用关联矩阵追踪其中出现频率最高的概念对。该矩阵显示,第一级过滤器产生了一些几乎没有任何关联的概念对。为了去除这些不需要的概念对,我们使用其阳性预测值 (PPV) 和灵敏度 (Sensitivity) 的等权调和平均数作为第二级过滤器。实验结果证明了该方法的有效性。
引用
@article{arxiv.1307.8057,
title = {Extracting Connected Concepts from Biomedical Texts using Fog Index},
author = {Rushdi Shams and Robert E. Mercer},
journal= {arXiv preprint arXiv:1307.8057},
year = {2013}
}
备注
12th Conference of the Pacific Association for Computational Linguistics (PACLING 2011), Kuala Lumpur, Malaysia, July 19-21, 2011