使用基于 Transformer 的集成学习对科学文献进行分类
计算与语言
2021-05-05 v2
摘要
很多时候审稿人未能领会研究者的新颖想法并给出泛泛的反馈。因此,依据审稿人的专业领域进行恰当分配是必要的。此外,为将每篇论文分配至相应审稿人而从头到尾通读是一项繁琐任务。在本文中,我们描述了我们的团队 FideLIPI 在 SDPRA-2021 [14] 共享任务中提交的系统。该系统由四个独立子系统组成,能够将科学文献摘要分类至给定七个类别之一。第一个是基于这些摘要构建的 RoBERTa [10] 模型。向第一个模型添加主题模型 / 隐狄利克雷分配(Latent Dirichlet Allocation, LDA) [2] 特征得到第二个子系统。第三个是句子级 RoBERTa [10] 模型。第四个是使用词频-逆文档频率(Term Frequency Inverse Document Frequency, TF-IDF)特征构建的逻辑回归(Logistic Regression)模型。我们通过多数投票集成这四个子系统的预测,开发出最终系统,在测试集与验证集上取得 0.93 的 F1 分数。这在验证集上的 F1 分数优于现有的 State Of The Art (SOTA) 模型 SciBERT [1]。我们的代码库位于 https://github.com/SDPRA-2021/shared-task/tree/main/FideLIPI
引用
@article{arxiv.2102.09991,
title = {Using Transformer based Ensemble Learning to classify Scientific Articles},
author = {Sohom Ghosh and Ankush Chopra},
journal= {arXiv preprint arXiv:2102.09991},
year = {2021}
}
备注
8 pages, 3 tables, 1 figure, Trends and Applications in Knowledge Discovery and Data Mining. PAKDD 2021. Lecture Notes in Computer Science, Springer