中文

ChatGPT 能在哪些领域检测期刊论文质量?对 REF2021 结果的评估

数字图书馆 2025-09-05 v1

摘要

如果自动化方法能提供帮助,学者花在研究质量评估上的时间可能会减少。尽管基于引用的指标已被广泛开发和评估,但它们存在实质性局限,而像 ChatGPT 这样的大型语言模型(LLM)提供了一种替代方法。本文评估了 ChatGPT 4o-mini 能否用于估计整个学术界期刊论文的质量。它从英国 2021 卓越研究框架(REF)的所有 34 个评估单元(UoA)中抽取最多 200 篇论文,将 ChatGPT 的评分与院系平均分进行比较。ChatGPT 评分与院系平均分之间几乎普遍存在正的 Spearman 相关系数,在 0.08(哲学)和 0.78(心理学、精神病学和神经科学)之间变化,但临床医学除外(rho=-0.12)。尽管可能有其他解释,特别是由于 REF 评分概况是公开的,但结果表明,LLM 在大多数科学领域,特别是物理科学、健康科学和工程领域,甚至在引用数据可用之前,就能提供合理的研究质量估计。然而,与其他领域相比,ChatGPT 的评估对大多数健康和物理科学似乎更为积极,这对于多学科评估是一个隐患;而且 ChatGPT 的评分仅基于标题和摘要,因此不能算作研究评估。

关键词

引用

@article{arxiv.2409.16695,
  title  = {In which fields can ChatGPT detect journal article quality? An evaluation of REF2021 results},
  author = {Mike Thelwall and Abdallah Yaghi},
  journal= {arXiv preprint arXiv:2409.16695},
  year   = {2025}
}