中文

大型语言模型能否评估项目申请质量?重读瓦纳-奥斯与沃尔德同行评审数据

数字图书馆 2026-03-17 v1

摘要

目的:尽管同行评审对项目资助决策至关重要,但学者们往往不愿进行此类工作。这会导致提交后至最终决定之间的时间延迟,以及来自忙碌或非专家学者的质量不佳评审的风险。至少有一个资助机构现已采用大型语言模型(Large Language Models, LLMs)以减轻评审负担,但需评估 LLMs 对项目申请评分的准确性。设计/方法/路径:本文将多种中等规模开源权重 LLM 的评分与来自 1994 年瑞典医学理事会博士后奖学金申请的同行评分进行比较。发现:尽管 LLM 彼此之间的评分相关性中等(平均 Spearman 相关系数:0.34),但它们与专家平均评分之间的相关性虽弱却为正,且大多数情况下具有统计显著性(平均 Spearman 相关系数:0.22)。最高的专家评分与 LLM 之间的排名相关系数为 Gemma 3 27b(仅基于项目标题和摘要,不包含正文),为 0.33,这约为同行评分相关系数的 56%。研究限制:样本量较小、资助调用较旧、评估标准异质性都削弱了分析的稳健性。实践意义:尽管 LLM 评分的定量准确性低于专家,但在本特殊案例中,它们可能在申请筛选或抉择中发挥作用。原创性/价值:本文首次评估了 LLM 评分在项目资助中的价值。

关键词

引用

@article{arxiv.2603.14565,
  title  = {Can Large Language Models Evaluate Grant Proposal Quality? Revisiting the Wenner{\aa}s and Wold Peer Review Data},
  author = {Ulf Sandström and Mike Thelwall},
  journal= {arXiv preprint arXiv:2603.14565},
  year   = {2026}
}