中文

小型和较大推理型语言模型能否为期刊文章评估研究质量?平均池化和零样本学习是否有效?

数字图书馆 2026-02-18 v2 人工智能

摘要

先前的研究表明,来自基于云端的大型语言模型(LLM)家族ChatGPT和Gemini,以及中等规模的开源权重模型Gemma3 27b,与专家研究质量评分之间存在中等程度的相关性。本文评估了其他中等规模LLMs、较小的LLMs以及推理模型是否具有类似能力。通过在6个医学、健康和生命科学领域的2780篇论文数据集上测试Gemma3变体、Llama4 Scout、Qwen3、Magistral Small和DeepSeek R1,以及两种金标准(其中一种为新颖的),评估了零样本学习和评分平均化方法。结果表明,中等规模的LLMs的性能相当于ChatGPT 4o-mini和Gemini 2.0 Flash,但10亿参数可能常常不够,40亿参数有时也不够。推理模型并未显示出明确的优势。此外,来自多个相同查询的评分平均化似乎是一个普遍成功的策略,且零样本提示(四个示例)帮助的证据较弱。总体而言,结果首次表明,参数大于40亿的较小LLMs在评估期刊文章研究质量方面具有相当大的能力,尤其是在使用评分平均化的情况下,但推理并不为此任务提供优势,因此不建议使用,因为其速度较慢。由于多个变体都具有类似的能力,LLMs用于支持研究评估的可信度现在更高,包括许多可以在没有大量计算资源的情况下在安全环境中部署的模型。

关键词

引用

@article{arxiv.2510.22389,
  title  = {Can Small and Reasoning Large Language Models Score Journal Articles for Research Quality and Do Averaging and Few-shot Help?},
  author = {Mike Thelwall and Ehsan Mohammadi},
  journal= {arXiv preprint arXiv:2510.22389},
  year   = {2026}
}

备注

Thelwall, M. & Mohammadi, E. (2026). Can small and reasoning Large Language Models score journal articles for research quality and do averaging and few-shot help? Scientometrics