中文

大型语言模型、人类审阅者与作者在评估 rheumatology 中观察性研究 STROBE 检查表的一致性

数字图书馆 2026-03-23 v1 人工智能

摘要

介绍:评估符合 Strengthening the Reporting of Observational Studies in Epidemiology (STROBE) 声明的合规性往往耗时且主观。本研究比较了大型语言模型 (LLM)、人类审阅者小组和原始论文作者在 rheumatology 领域观察性研究中的 STROBE 评估结果。方法:遵循 GRRAS 和 DEAL Pathway B 框架,对 17 篇 rheumatology 文章进行独立评估。评估使用 22 项 STROBE 检查表,由作者、五人人类审阅小组(从初级到高级专业人员)以及两款 LLM (ChatGPT-5.2、Gemini-3Pro) 完成。将项目分为方法论严谨性和呈现与背景两个领域。计算使用 Gwet's Agreement Coefficient (AC1) 计算跨评估者可靠性。结果:所有审阅者之间的整体一致性为 85.0% (AC1=0.826)。领域分层显示,呈现与背景领域几乎完美一致 (AC1=0.841),方法论严谨性领域显示显著一致 (AC1=0.803)。尽管 LLM 在标准格式要素上与所有人类审阅者完全一致 (AC1=1.000),但在复杂项目上的一致性下降。例如,关于随访失访的项目,Gemini 3 Pro 与高级审阅者的一致性为 AC1=-0.252,而与作者的一致性仅为公差。此外,ChatGPT-5.2 在特定方法论项目上通常比 Gemini-3Pro 与人类审阅者的一致性更高。结论:尽管 LLM 在基础 STROBE 筛查方面显示出潜力,但其在复杂方法论项目上的低一致性反映了其依赖表层信息。目前,这些模型在标准化 straightforward 检查方面更可靠,而不适用于取代评估观察性研究中专家人类判断。

关键词

引用

@article{arxiv.2603.19303,
  title  = {Agreement Between Large Language Models, Human Reviewers, and Authors in Evaluating STROBE Checklists for Observational Studies in Rheumatology},
  author = {Emre Bilgin and Ebru Ozturk and Meera Shah and Lisa Traboco and Rebecca Everitt and Ai Lyn Tan and Marwan Bukhari and Vincenzo Venerito and Latika Gupta},
  journal= {arXiv preprint arXiv:2603.19303},
  year   = {2026}
}

备注

19 pages, 2 figures, 2 supplementary figures