中文

GPT-5 前沿模型在眼科问答中的性能评估

计算与语言 2025-08-15 v2

摘要

大型语言模型(LLMs)如 GPT-5 集成了先进的推理能力,可能提高在复杂医学问答任务上的性能。对于这一最新一代推理模型,尚未确立能够最大化准确性和成本效益的配置。我们评估了 OpenAI GPT-5 系列的 12 种配置(三个模型层级跨四种推理 effort 设置),以及 o1-high、o3-high 和 GPT-4o,采用 260 题的封闭式多选问题来自美国眼科学会基础临床科学课程(BCSC)数据集。主要结果是多选准确率;次要结果包括通过巴特榜模型进行的头对头排名、使用参考锚定、成对 LLM 评判框架对 rationale 质量的评估,以及使用基于 token 的成本估计分析准确率-成本权衡。GPT-5-high 实现了最高准确率(0.965;95% 置信区间 0.942-0.985),超过所有 GPT-5-nano 变体(P < .001)、o1-high(P = .04)和 GPT-4o(P < .001),但未超过 o3-high(0.958;95% 置信区间 0.931-0.981)。GPT-5-high 在准确率(1.66 倍强于 o3-high)和 rationale 质量(1.11 倍强于 o3-high)方面均位居第一。成本-准确率分析识别出若干 GPT-5 配置位于帕累托前沿,其中 GPT-5-mini-low 提供了最具性价比的低成本、高性能平衡。这些结果对 GPT-5 在高质量眼科数据集上进行基准测试,展示了推理 effort 对准确率的影响,并为在眼科中对 LLM 生成答案进行可扩展评估引入了自动评分框架。

关键词

引用

@article{arxiv.2508.09956,
  title  = {Performance of GPT-5 Frontier Models in Ophthalmology Question Answering},
  author = {Fares Antaki and David Mikhail and Daniel Milad and Danny A Mammo and Sumit Sharma and Sunil K Srivastava and Bing Yu Chen and Samir Touma and Mertcan Sevgi and Jonathan El-Khoury and Pearse A Keane and Qingyu Chen and Yih Chung Tham and Renaud Duval},
  journal= {arXiv preprint arXiv:2508.09956},
  year   = {2025}
}