中文

使用 GPT 和其他文本嵌入预测科研论文的引用影响

数字图书馆 2024-07-30 v1

摘要

科研论文的影响力通常通过引用次数来衡量,取决于作者、期刊和机构的声誉,以及科学工作的质量。本文提出了一种结合自然语言处理和机器学习的方法,用于预测特定期刊中论文的影响力。我们的焦点是文本,这应与影响力以及论文涵盖的主题相关。我们使用了来自 ACS Applied Materials and Interfaces(2012-2022 年)超过 40,000 篇文章的数据集。该数据使用各种文本嵌入技术处理,并使用监督机器学习算法进行分类。将论文归类为该期刊中最常被引用的前 20%。我们使用年引用计数和累计引用计数作为指标。我们的分析表明,使用生成式预训练变换器(GPT)的嵌入方法最为高效,而随机森林算法在机器学习算法中表现出最佳的预测能力。当处理摘要时,实现对论文是否位于该期刊最常被引用的前 20%的预测的最佳准确率为 80%。这一准确率值得注意,考虑到作者、机构和早期引用模式信息均未被考虑在内。仅处理论文全文时,准确率仅略有增加。另一个显著发现是,较简单的嵌入技术,即术语频率 - 逆文档频率(TFIDF),的性能接近 GPT。这表明,除了考虑作者和机构偏见外,引用计数可能通过识别论文的主题和“阅读”摘要来预测。

关键词

引用

@article{arxiv.2407.19942,
  title  = {Predicting citation impact of research papers using GPT and other text embeddings},
  author = {Adilson Vital and Filipi N. Silva and Osvaldo N. Oliveira and Diego R. Amancio},
  journal= {arXiv preprint arXiv:2407.19942},
  year   = {2024}
}