大型语言模型用于院系级专家评审质量评分
数字图书馆
2026-01-28 v1
摘要
据推测,同行评审员和大型语言模型(LLMs)在被要求评估研究时,所做的事情非常不同。尽管如此,最近的证据表明,LLMs具有中等程度的预测已发表学术期刊文章质量评分的能力。LLMs的一个未经测试的潜在应用是用于内部院系评审,这可能用于支持任命和晋升决策,或为全国性评估遴选成果。本研究首次评估了以下方面的程度:(1)LLM质量评分与内部院系质量评级的吻合程度,以及(2)LLM报告与专家报告的差异。使用来自谢菲尔德大学信息学院的58篇已发表期刊文章的私有数据集,以及内部院系质量评级和报告,ChatGPT-4o、ChatGPT-4o mini和Gemini 2.0 Flash的评分与内部院系评级呈正相关且中等程度的相关,无论输入仅是标题/摘要还是全文。院系评审往往更具体,并展现出领域级知识,而ChatGPT报告则倾向于标准化、更笼统、重复,并带有未经请求的改进建议。因此,这些结果(a)证实了LLMs能够较好地猜测已发表学术研究的质量评分,(b)证实了这种能力是一种猜测而非评估(因为它可以仅基于标题/摘要做出),(c)将这种能力扩展到内部院系专家评审,以及(d)表明对于已发表的学术期刊文章,LLM报告的洞察力不如人类专家报告。
引用
@article{arxiv.2601.18945,
title = {Large Language Models for Departmental Expert Review Quality Scores},
author = {Liv Langfeldt and Dag W. Aksnes and Henrik Karlstrøm and Mike Thelwall},
journal= {arXiv preprint arXiv:2601.18945},
year = {2026}
}