利用基于 BERT 的模型赋能跨学科研究:基于 SciBERT-CNN 与主题建模的方法
计算与语言
2024-04-24 v2 机器学习
摘要
研究人员必须通过定期查阅学术文献来跟上其领域的最新进展,而每天发表数千篇论文使这项任务变得复杂。传统的多标签文本分类方法通常忽略语义关系,并且未能解决固有的类别不平衡问题。本文介绍了一种使用 SciBERT 模型和 CNN 系统地对 Elsevier OA CC-BY 语料库中的学术摘要进行分类的新方法。我们采用多段输入策略,通过 SciBERT 处理通过 BERT 主题建模获得的摘要、正文、标题和关键词。在此,[CLS] token 嵌入捕获每个段的上下文表示,并将其拼接后通过 CNN 处理。CNN 利用卷积和池化来增强特征提取并降低维度,从而优化数据以进行分类。此外,我们结合基于标签频率的类别权重来解决类别不平衡问题,显著提高了分类 F1 分数,并增强了文本分类系统和文献综述效率。
引用
@article{arxiv.2404.13078,
title = {Empowering Interdisciplinary Research with BERT-Based Models: An Approach Through SciBERT-CNN with Topic Modeling},
author = {Darya Likhareva and Hamsini Sankaran and Sivakumar Thiyagarajan},
journal= {arXiv preprint arXiv:2404.13078},
year = {2024}
}