中文

评估ChatGPT在多个平台上预测学术同行评审结果的能力

数字图书馆 2024-11-18 v1 计算与语言

摘要

虽然先前研究已表明大语言模型(LLMs)在一定程度上能预测同行评审结果,但本文通过引入两个新情境并采用更稳健的方法——平均多个ChatGPT评分——在此基础上进行了拓展。研究发现,基于评审指南且仅使用提交的标题和摘要,平均30次ChatGPT预测无法预测F1000Research的同行评审结果(Spearman's rho=0.00)。然而,它对SciPost Physics的质量维度产生了大多为弱正相关(效度rho=0.25,原创性rho=0.25,重要性rho=0.20,清晰度rho=0.08),并对国际学习表征会议(ICLR)的论文产生了中等正相关(rho=0.38)。纳入文章全文显著提高了ICLR的相关性(rho=0.46),略微改善了F1000Research(rho=0.09),而对SciPost LaTeX文件的四个质量维度相关性影响不一。使用思维链系统提示略微提高了F1000Research的相关性(rho=0.10),边际降低了ICLR(rho=0.37),并进一步降低了SciPost Physics(效度rho=0.16,原创性rho=0.18,重要性rho=0.18,清晰度rho=0.05)。总体而言,结果表明在某些情境下,ChatGPT能给出弱的出版前质量评估。然而,这些评估的有效性及最佳使用策略在不同平台、期刊和会议间差异显著。此外,ChatGPT最适合的输入似乎因平台而异。

关键词

引用

@article{arxiv.2411.09763,
  title  = {Evaluating the Predictive Capacity of ChatGPT for Academic Peer Review Outcomes Across Multiple Platforms},
  author = {Mike Thelwall and Abdullah Yaghi},
  journal= {arXiv preprint arXiv:2411.09763},
  year   = {2024}
}