中文

用于识别科学可靠文章的级联神经集成方法

计算与语言 2020-04-15 v1 信息检索 机器学习

摘要

背景:进行系统综述和荟萃分析的一个重大障碍是高效找到科学可靠的相关文章。通常,符合此要求的文章不足 1%,这导致了一项高度不平衡的任务。尽管已有研究针对该任务探讨了特征工程模型和早期神经网络模型,但仍有改进结果的空间。方法:我们将文章筛选问题构建为分类任务,并在一个来自 MEDLINE、约 50K 篇人工标注文章的数据集上,训练并测试了 SciBERT(一种在科学文章上预训练的 BERT 变体)的若干集成架构。由于科学可靠文章是通过多步骤过程识别的,我们提出了一种类似于筛选过程的新型级联集成。我们将级联集成的性能与单一集成模型、其他类型集成以及以往研究的结果进行了比较。结果:级联集成架构取得了 0.7505 的 F 值,与先前在 50K 文章选定子集上提出并评估的 CNN 模型相比,错误率显著降低 49.1%。在完整数据集上,级联集成取得了 0.7639 的 F 值,与先前使用完整数据集的研究所报告的最佳性能相比,错误率降低 19.7%。结论:预训练上下文编码器神经网络(如 SciBERT)在筛选科学可靠相关文章方面优于先前研究的模型和人工创建的检索过滤器。级联集成所实现的优越性能是一项重要结果,可推广至该任务和数据集之外,并类似于信息检索(IR)和数据库中的查询优化。

关键词

引用

@article{arxiv.2004.06222,
  title  = {Cascade Neural Ensemble for Identifying Scientifically Sound Articles},
  author = {Ashwin Karthik Ambalavanan and Murthy Devarakonda},
  journal= {arXiv preprint arXiv:2004.06222},
  year   = {2020}
}

备注

11 pages, 4 figures, and 9 tables