P1: 通过强化学习掌握物理奥林匹克
机器学习
2025-11-18 v1 人工智能
计算与语言
摘要
近期大型语言模型 (LLM) 的进展正从解谜能力推向科学推理能力——这种能力对于解决必须抵御自然界约束而非仅满足评分标准的问题至关重要。物理学是这一转变的尖端测试,因为它将符号与现实建立根本性联系,构成大多数现代技术的基石。本文通过开发具备卓越物理推理能力的大型语言模型来推进物理研究,尤其擅长解决奥林匹克水平的物理问题。我们引入 P1,一系列完全通过强化学习 (RL) 训练的开源物理推理模型。其中 P1-235B-A22B 是首个在最新国际物理奥林匹克 (IPhO 2025) 中获得金牌的开源模型,2024/2025 年在 13 项国际/区域物理竞赛中获金牌 12 项。P1-30B-A3B 也在 IPhO 2025 上超越绝大多数开源模型,获得银牌。进一步配合 agentic 框架 PhysicsMinions,P1-235B-A22B+PhysicsMinions 在 IPhO 2025 上名列第一,获得 13 项物理竞赛的最高平均得分。除了物理学,P1 模型在数学和编程等其他推理任务上也表现出色,显示出 P1 系列的广泛可迁移性。
引用
@article{arxiv.2511.13612,
title = {P1: Mastering Physics Olympiads with Reinforcement Learning},
author = {Jiacheng Chen and Qianjia Cheng and Fangchen Yu and Haiyuan Wan and Yuchen Zhang and Shenghe Zheng and Junchi Yao and Qingyang Zhang and Haonan He and Yun Luo and Yufeng Zhao and Futing Wang and Li Sheng and Chengxing Xie and Yuxin Zuo and Yizhuo Li and Wenxauan Zeng and Yulun Wu and Rui Huang and Dongzhan Zhou and Kai Chen and Yu Qiao and Lei Bai and Yu Cheng and Ning Ding and Bowen Zhou and Peng Ye and Ganqu Cui},
journal= {arXiv preprint arXiv:2511.13612},
year = {2025}
}