中文

科学文本分类:通过数据扩充与硬投票实现的微调模型

计算与语言 2025-09-09 v2 人工智能

摘要

高效文本分类对于处理日益增长的学术出版物量是必不可少的。本研究探讨了使用预训练语言模型(PLM),包括BERT、SciBERT、BioBERT和BlueBERT,在Web of Science(WoS-46985)数据集上进行微调进行科学文本分类。为提升性能,我们通过在WoS数据库中执行七次针对性查询,检索出与WoS-46985主要类别匹配的每类1000篇文章。PLM对这些未标记的数据进行标签预测,硬投票策略组合预测结果以提高准确率和置信水平。在使用动态学习率和早期停止进行扩充数据集上的微调后,分类准确率显著提升,尤其在专门领域中表现更佳。领域特定模型如SciBERT和BioBERT持续优于通用模型如BERT。这些发现凸显了数据扩充、推理驱动的标签预测、硬投票和微调技术在创建用于自动化学术文本分类的稳健且可扩展解决方案方面的有效性。

关键词

引用

@article{arxiv.2504.19021,
  title  = {Advancing Scientific Text Classification: Fine-Tuned Models with Dataset Expansion and Hard-Voting},
  author = {Zhyar Rzgar K Rostam and Gábor Kertész},
  journal= {arXiv preprint arXiv:2504.19021},
  year   = {2025}
}

备注

6 pages, 1 figure, 8 tables