中文

大型语言模型在挑战性生物学基准测试中超越人类专家

机器学习 2025-05-23 v3 人工智能 定量方法

摘要

本研究系统评估了 27 个前沿大型语言模型在八个生物学基准测试上的表现,这些基准测试涵盖分子生物学、遗传学、克隆、病毒学和生物安全。对 2022 年 11 月至 2025 年 4 月期间主要 AI 开发者发布的模型,通过每个基准测试的十次独立运行进行评估。研究结果揭示了生物学能力的显著提升。在研究期间,顶级模型在病毒学能力测试的挑战性纯文本子集上的性能提高了 4 倍以上,OpenAI 的 o3 模型现在的表现是病毒学专家的两倍。多个模型现在在其他挑战性基准测试上达到或超过了专家级水平,包括 GPQA 和 WMDP 的生物学子集以及 LAB-Bench CloningScenarios。与预期相反,思维链并未比零样本评估显著提高性能,而 o3-mini 和 Claude 3.7 Sonnet 中的扩展推理功能通常如推理缩放所预测的那样提高了性能。PubMedQA 以及 MMLU 和 WMDP 的生物学子集等基准测试表现出远低于 100% 的性能平台期,这表明基准测试饱和以及底层基准数据存在错误。该分析强调,随着 AI 系统的不断进步,需要更复杂的评估方法。

关键词

引用

@article{arxiv.2505.06108,
  title  = {LLMs Outperform Experts on Challenging Biology Benchmarks},
  author = {Lennart Justen},
  journal= {arXiv preprint arXiv:2505.06108},
  year   = {2025}
}