中文

面向生物医学自然语言处理的GPT-5基准测试

计算与语言 2025-10-24 v2 人工智能

摘要

生物医学文献和临床叙述对自然语言理解提出了多方面的挑战,从精确的实体提取、文档综合到多步诊断推理。本研究扩展了一个统一的基准,在零样本、单样本和五样本提示下评估 GPT-5 和 GPT-4o,涵盖五个核心生物医学 NLP 任务:命名实体识别、关系抽取、多标签文档分类、摘要生成和简化,以及九个扩展的生物医学问答数据集,涉及事实知识、临床推理和多模态视觉理解。使用标准化的提示、固定的解码参数和一致的推理流程,我们在官方定价下评估了模型性能、延迟和 token 归一化成本。GPT-5 始终优于 GPT-4o,在 MedXpertQA 和 DiagnosisArena 等推理密集型数据集上增益最大,并在多模态问答中表现出稳定的提升。在核心任务中,GPT-5 取得了更好的化学 NER 和 ChemProt 分数,但在疾病 NER 和摘要生成方面仍低于领域微调的基线。尽管生成了更长的输出,GPT-5 表现出相当的延迟,且每次正确预测的有效成本降低了 30% 至 50%。细粒度分析显示,在诊断、治疗和推理子类型方面有所改善,而边界敏感的抽取和证据密集的摘要生成仍然具有挑战性。总体而言,GPT-5 在生物医学问答方面接近可部署的性能水平,同时在准确性、可解释性和经济效率之间提供了良好的平衡。结果支持分层提示策略:对于大规模或成本敏感的应用采用直接提示,对于分析复杂或高风险场景采用思维链支架,突显了在精度和事实保真度至关重要的场景中持续需要混合解决方案。

关键词

引用

@article{arxiv.2509.04462,
  title  = {Benchmarking GPT-5 for biomedical natural language processing},
  author = {Yu Hou and Zaifu Zhan and Min Zeng and Yifan Wu and Shuang Zhou and Rui Zhang},
  journal= {arXiv preprint arXiv:2509.04462},
  year   = {2025}
}