中文

从文字到价值:基于大语言模型的新生文章影响力预测

计算与语言 2024-12-17 v2

摘要

随着学术领域的扩展,高效识别新发表文章影响力的挑战变得愈发重要。本文提出了一种有前景的方法,利用大语言模型(LLM)的能力,仅基于标题和摘要来预测新生文章的未来影响力。该方法超越了传统上严重依赖外部信息的方法,通过大语言模型从大量标题-摘要对中识别高影响力论文的共享语义特征。这些语义特征进一步用于预测所提出的指标 TNCSI_SP,该指标在数值、领域和时间维度上均具有有利的归一化性质。为了实现大语言模型的参数高效微调,我们还精心策划了一个包含超过 12,000 条记录的数据集,每条记录均标注了标题、摘要及其对应的 TNCSI_SP 值。定量结果(MAE 为 0.216,NDCG@20 为 0.901)表明,与多种有前景的方法相比,所提出的方法在预测新生文章影响力方面达到了最先进性能。最后,我们展示了一个预测新生期刊文章影响力的实际应用案例,以证明其显著的实用价值。总体而言,我们的发现挑战了现有范式,并提出了一种向更以内容为导向的学术影响力预测方式的转变,为文章影响力预测提供了新的见解。

关键词

引用

@article{arxiv.2408.03934,
  title  = {From Words to Worth: Newborn Article Impact Prediction with LLM},
  author = {Penghai Zhao and Qinghua Xing and Kairan Dou and Jinyu Tian and Ying Tai and Jian Yang and Ming-Ming Cheng and Xiang Li},
  journal= {arXiv preprint arXiv:2408.03934},
  year   = {2024}
}

备注

Accepted by AAAI 2025. Code, dataset are released at https://sway.cloud.microsoft/KOH09sPR21Ubojbc