大规模生物医学文本分类:基于 kNN 与 ESA 的方法
摘要
随着文本数据量的庞大且不断增长,用于识别重要主题以对文本文档进行分类的自动化方法受到了越来越多的关注。尽管在此方向上已做出许多努力,但这仍然是一个真正的挑战。此外,由于全文并不总是免费提供的,该问题变得更加复杂。因此,仅使用部分信息来标注这些文档是有前景的,但仍然是一个非常具有挑战性的问题。方法:我们提出了两种分类方法:一种基于 k 近邻 (kNN) 的方法和一种基于显式语义分析 (ESA) 的方法。尽管基于 kNN 的方法广泛用于文本分类,但在此处理部分信息的特定分类问题中,需要对其进行改进以获得良好性能。与现有的基于 kNN 的方法相比,我们的方法使用经典的机器学习 (ML) 算法对标签进行排序。此外,还研究了附加特征以提高分类器的性能。另外,将多种学习算法与用于确定相关主题数量的各种技术相结合。另一方面,ESA 在此分类任务中似乎很有前景,因为它在语义相关度计算和文本分类等相关问题中取得了不错的结果。与使用 ESA 通过额外的基于知识的特征来丰富词袋方法的现有工作不同,我们基于 ESA 的方法构建了一个独立的分类器。此外,我们还研究了该方法的结果是否可以作为基于 kNN 方法的补充特征。结果:在由 BioASQ 组织者提供的大规模标准标注数据集上进行的实验评估表明,与当前最先进的方法相比,使用随机森林学习算法的基于 kNN 的方法取得了良好的性能,达到了 0.55% 的有竞争力的 f-measure,而基于 ESA 的方法出乎意料地得到了保守的结果。结论:我们提出了简单的分类方法,适合仅使用部分信息来标注文本文档。因此,它们适用于大规模多标签分类,特别是在生物医学领域。因此,我们的工作有助于从非结构化文档中提取相关信息,以促进其自动化处理。因此,它可以用于各种目的,包括文档索引、信息检索等。
引用
@article{arxiv.1606.02976,
title = {Large scale biomedical texts classification: a kNN and an ESA-based approaches},
author = {Khadim Dramé and Fleur Mougin and Gayo Diallo},
journal= {arXiv preprint arXiv:1606.02976},
year = {2016}
}
备注
Journal of Biomedical Semantics, BioMed Central, 2016