中文

FrontierScience:评估 AI 执行专家水平科学任务的能力

人工智能 2026-01-30 v1 计算机与社会 机器学习

摘要

我们介绍 FrontierScience,一个评估前沿语言模型中专家水平科学推理能力的基准测试。最近的模型进展几乎饱和了现有的科学基准测试,这些基准测试通常依赖于多选式知识问题或已发布的信息。FrontierScience 通过两个互补的轨道来填补这一差距:(1) 奥林匹克赛,包含国际奥林匹克赛问题,水平相当于 IPhO、IChO 和 IBO;(2) 研究,包含 PhD 水平的开放性问题,代表性地代表了科学研究中的各个子任务。FrontierScience 包含数百个问题(包括 160 个在开源金集中),覆盖物理、化学和生物学等子领域,从量子电动力学到合成有机化学。所有奥林匹克赛问题均由国际奥运会奖牌得主和国家队教练原创生产,以确保难度、原创性和事实性。所有研究问题均由 PhD 科学家(博士后研究员或教授)撰写并验证。对于研究问题,我们引入了基于细粒度评分标准的评估框架,以评估模型在解决研究任务过程中各个环节的能力,而不仅仅是对独立最终答案的判断。

关键词

引用

@article{arxiv.2601.21165,
  title  = {FrontierScience: Evaluating AI's Ability to Perform Expert-Level Scientific Tasks},
  author = {Miles Wang and Robi Lin and Kat Hu and Joy Jiao and Neil Chowdhury and Ethan Chang and Tejal Patwardhan},
  journal= {arXiv preprint arXiv:2601.21165},
  year   = {2026}
}