P1-VL:连接物理奥林匹克中的视觉感知与科学推理
人工智能
2026-02-11 v1
摘要
从符号操作过渡到科学级推理是大型语言模型(LLM)的关键前沿,物理学作为关键测试锚点,能够将抽象逻辑与物理现实相结合。物理学要求模型必须与支配宇宙的物理法则保持一致,这本质上需要多模态感知将抽象逻辑锚定在现实世界。奥林匹克级别的物理学问题中,图示往往是构成性的而非仅作说明,包含边界条件和空间对称性等关键约束,这些约束在文本中是缺失的。为弥合这种视觉-逻辑鸿沟,我们引入 P1-VL,一套为高级科学推理设计的开源视觉-语言模型。我们的方法将课程强化学习相结合,该方法采用渐进式难度扩张以稳定微调,同时引入智能体增强,使其在推理时能够进行自我验证。我们在 HiPhO 上进行评估,该基准包含 2024-2025 年的 13 场考试。我们的旗舰型号 P1-VL-235B-A22B 成为首个获得 12 枚金牌并在开源模型中实现最佳性能的视觉-语言模型(VLM)。我们的智能体增强系统在全球排名中名列第 2,仅落后于 Gemini-3-Pro。除物理学外,P1-VL 在 STEM 基准测试中也展示出显著的科学推理能力和广泛性,显著优于基线模型。通过开放源码 P1-VL,我们为通用物理智能提供了一大步,旨在更好地将视觉感知与抽象物理法则对齐,以促进机器科学发现。
引用
@article{arxiv.2602.09443,
title = {P1-VL: Bridging Visual Perception and Scientific Reasoning in Physics Olympiads},
author = {Yun Luo and Futing Wang and Qianjia Cheng and Fangchen Yu and Haodi Lei and Jianhao Yan and Chenxi Li and Jiacheng Chen and Yufeng Zhao and Haiyuan Wan and Yuchen Zhang and Shenghe Zheng and Junchi Yao and Qingyang Zhang and Haonan He and Wenxuan Zeng and Li Sheng and Chengxing Xie and Yuxin Zuo and Yizhuo Li and Yulun Wu and Rui Huang and Dongzhan Zhou and Kai Chen and Yu Qiao and Lei Bai and Yu Cheng and Ning Ding and Bowen Zhou and Peng Ye and Ganqu Cui},
journal= {arXiv preprint arXiv:2602.09443},
year = {2026}
}