中文

GPT-5 在关键领域的能力:它是下一个突破吗?

人机交互 2025-08-28 v1 计算与语言

摘要

大型语言模型的加速演进引发了关于其在具有实际重要性的各领域间相对表现的疑问。OpenAI 的 GPT-4 在推理、多模态和任务泛化方面引入了进步,确立了其作为教育、临床诊断和学术写作中有价值工具的地位,尽管也伴随着若干缺陷。于 2025 年 8 月发布的 GPT-5 采用了专为任务特定优化设计的系统多模型架构,并且基于轶事叙述和文献中的新兴证据,在医疗语境中表现出比其前身更优的性能。本研究利用来自语言学和临床领域的人类评估者,对 GPT-4 和 GPT-5 进行了最早的系统性比较之一。二十位专家根据预定义标准评估了五个领域中的模型生成输出:课程规划、作业评估、临床诊断、研究生成和伦理推理。混合效应模型显示,GPT-5 在课程规划、临床诊断、研究生成和伦理推理方面显著优于 GPT-4,而两个模型在作业评估中表现相当。研究结果突出了 GPT-5 作为具有上下文敏感性和领域专业化工具的潜力,为教育、临床实践和学术研究提供了切实益处,同时推进了伦理推理。这些结果为 GPT-5 不断演进的能力和实际前景的最早实证评估之一做出了贡献。

关键词

引用

@article{arxiv.2508.19259,
  title  = {Capabilities of GPT-5 across critical domains: Is it the next breakthrough?},
  author = {Georgios P. Georgiou},
  journal= {arXiv preprint arXiv:2508.19259},
  year   = {2025}
}