利用 ChatGPT 评估已发表医学研究的质量
数字图书馆
2025-03-10 v2 人工智能
摘要
评估已发表研究的质量对于部门、研究人员和求职候选人的评价具有重要意义。基于引文的指标有时可支持这些任务,但对新文章不适用且准确率较低或中等。先前的研究已表明 ChatGPT 可以估计研究文章的质量,其得分与所有领域专家评分代理呈正相关,且通常比基于引文的指标相关性更强,临床医学除外。因此,ChatGPT 得分可能在某些应用中替代基于引文的指标。本文利用迄今最大的数据集和更详细的分析,调查了临床医学领域的这一异常现象。结果表明,提交至英国卓越研究框架(Research Excellence Framework, REF)2021 年评估单元(Unit of Assessment, UoA)1 临床医学的文章,ChatGPT 4o-mini 得分与部门平均 REF 得分呈正相关(r=0.134, n=9872),而理论最大相关性为 r=0.226。ChatGPT 4o 和 3.5 turbo 也给出了正相关。在部门层面,平均 ChatGPT 得分与部门平均 REF 得分的相关性更强(r=0.395, n=31)。对于 UoA 1 中文章最多的 100 种期刊,其平均 ChatGPT 得分与 REF 得分相关性很强(r=0.495),但与引用率呈负相关(r=-0.148)。这些结果中的期刊和部门异常表明,ChatGPT 在评估 prestigious 医学期刊或直接影响人类健康的研究质量方面可能效果不佳,或两者兼有。然而,结果提供了 ChatGPT 整体评估临床医学研究质量的能力证据,在新研究中它可能替代基于引文的指标。
引用
@article{arxiv.2411.01952,
title = {Evaluating the quality of published medical research with ChatGPT},
author = {Mike Thelwall and Xiaorui Jiang and Peter A. Bath},
journal= {arXiv preprint arXiv:2411.01952},
year = {2025}
}
备注
Information Processing & Management (2025)