基于多标签分类模型集成的生物医学文献大规模在线语义索引
机器学习
2017-04-19 v1 机器学习
摘要
背景:在本文中,我们提出为处理生物医学文献大规模多标签语义索引任务所采用的方法与途径。该工作主要在2014年BioASQ挑战赛背景下实现。方法:本工作的主要贡献是一种多标签集成方法,其结合了McNemar统计显著性检验以验证组成机器学习算法的组合。一些次要贡献包括对BioASQ语料库时间特性(观察结果也适用于BioASQ的超集PubMed文献集)的研究,以及对所用算法针对该具有挑战性分类任务的适当改造。结果:我们开发的集成方法在BioASQ语料库子集的实验场景中与其它方法比较给出了积极结果。在BioASQ 2014挑战赛中,我们在第一批获得第一,随后两批获得第三。我们在BioASQ挑战赛中的成功证明,一种未实现任何启发式和基于规则方法的全自动化机器学习方法,在类似挑战性环境中可以极具竞争力并优于其他方法。
引用
@article{arxiv.1704.05271,
title = {Large-Scale Online Semantic Indexing of Biomedical Articles via an Ensemble of Multi-Label Classification Models},
author = {Yannis Papanikolaou and Grigorios Tsoumakas and Manos Laliotis and Nikos Markantonatos and Ioannis Vlahavas},
journal= {arXiv preprint arXiv:1704.05271},
year = {2017}
}