ForeCite:适配预训练语言模型以预测学术论文的未来引用率
机器学习
2025-05-15 v1 计算与语言
摘要
预测学术论文的未来引用率是实现研究评估自动化和加速科学进步的重要一步。我们提出 ForeCite,一个简单而强大的框架,通过在线性头部附加预训练因果语言模型来预测平均月度引用率。通过将 transformer 适配于回归任务,ForeCite 在一个经过筛选的 2000 年至 2024 年发表的 90 万余篇生物医学论文数据集上实现了 ρ = 0.826 的测试相关性,较之前的最先进方法提升了 27 个百分点。全面的扩展律分析揭示了模型规模和数据量方面的一致增益,而时间保留实验证实了实际的鲁棒性。基于梯度的显著性热力图表明可能存在对标题和摘要文本的过度依赖。这些结果在预测学术研究的长期影响力方面建立了新的最先进水平,并为科学贡献的自动化、高保真评估奠定了基础。
引用
@article{arxiv.2505.08941,
title = {ForeCite: Adapting Pre-Trained Language Models to Predict Future Citation Rates of Academic Papers},
author = {Gavin Hull and Alex Bihlo},
journal= {arXiv preprint arXiv:2505.08941},
year = {2025}
}
备注
16 pages, 13 figures