中文

基于 SVM 的系统综述摘要筛选方法的大规模研究

信息检索 2018-01-17 v3 机器学习

摘要

系统综述中的一项主要任务是摘要筛选,即根据标题和摘要排除数据库搜索返回的数百或数千条不相关引文。因此,能够自动化摘要筛选过程的系统综述平台至关重要。针对此任务已提出多种方法。然而,由于以下挑战,很难清楚地理解这些方法在系统综述平台中的适用性:(1) 评估所提方法时使用了不重叠的指标;(2) 使用了极难收集的特征;(3) 仅使用少量综述进行评估;(4) 缺乏坚实的统计检验或方法的等价性分组。在本文中,我们使用了每条引文可提取的特征表示。我们在大量综述(6161篇)和指标(1111个)上评估了基于 SVM 的方法(常用方法),以基于坚实的统计检验提供方法的等价性分组。我们的分析还包括使用500500x22交叉验证对指标进行强变异性分析。虽然某些方法在不同指标和数据集上表现突出,但没有一种方法能主导全局。此外,我们观察到,在某些情况下,通过基于确定性的采样,仅需筛选 15-20% 的引文即可找到相关(被纳入)的引文。少数被纳入的引文呈现出异常特征,只有在经过大量筛选步骤后才能被发现。最后,我们提出了一种集成算法,根据引文的相关性生成55星评级。该算法结合了我们评估中的最佳方法,并通过其55星评级输出更易于理解的预测结果。

关键词

引用

@article{arxiv.1610.00192,
  title  = {A large scale study of SVM based methods for abstract screening in systematic reviews},
  author = {Tanay Kumar Saha and Mourad Ouzzani and Hossam M. Hammady and Ahmed K. Elmagarmid and Wajdi Dhifli and Mohammad Al Hasan},
  journal= {arXiv preprint arXiv:1610.00192},
  year   = {2018}
}