HiPhO:(M)LLMs 在最新高中物理奥林匹克竞赛基准测试中距离人类还有多远?
人工智能
2025-09-22 v4
摘要
最近,(M)LLM 的物理能力引起了越来越多的关注。然而,现有的物理基准测试存在两个主要缺口:它们既未系统且及时地覆盖物理奥林匹克竞赛等真实物理竞赛,也无法与人类进行直接性能对比。为弥补这些缺口,我们提出了 HiPhO,这是首个专注于高中物理奥林匹克竞赛并具有人机对齐评估的基准测试。具体而言,HiPhO 突出了三个关键创新。(1) 全面的数据:它汇编了 2024-2025 年的 13 份最新奥林匹克考试,涵盖国际和区域竞赛,并包含从纯文本到基于图表的混合模态问题。(2) 专业评估:我们采用官方评分方案进行细粒度的评分,包括答案层面和步骤层面,完全与人评阅者对齐,以确保高质量和领域特定的评估。(3) 与人类参赛者的对比:我们根据官方奖牌门槛为模型分配金、银、铜牌,从而实现在 (M)LLM 与人类参赛者之间的直接对比。我们对 30 个最先进 (M)LLM 的大规模评估表明:在 13 场考试中,开源 MLLM 大多保持在铜牌水平或以下;开源 LLM 展现出有前景的进展,获得了多个金牌;闭源推理 MLLM 可获得 6 至 12 枚金牌;大多数模型与满分之间仍有显著差距。这些结果凸显了开源模型与顶尖学生之间的性能差距、闭源模型的强大推理能力以及仍有待提升的空间。HiPhO,一个面向多模态物理推理的人机对齐奥林匹克基准测试,在 https://github.com/SciYu/HiPhO 开源,公开排行榜位于 https://phyarena.github.io/。
关键词
引用
@article{arxiv.2509.07894,
title = {HiPhO: How Far Are (M)LLMs from Humans in the Latest High School Physics Olympiad Benchmark?},
author = {Fangchen Yu and Haiyuan Wan and Qianjia Cheng and Yuchen Zhang and Jiacheng Chen and Fujun Han and Yulun Wu and Junchi Yao and Ruilizhen Hu and Ning Ding and Yu Cheng and Tao Chen and Lei Bai and Dongzhan Zhou and Yun Luo and Ganqu Cui and Peng Ye},
journal= {arXiv preprint arXiv:2509.07894},
year = {2025}
}