Physics-R1:经审计的奥林匹克语料库与视觉物理推理方案
摘要
我们对多模态物理评估流程进行了端到端审计,并记录了三种未被察觉的构建做法,它们扭曲了该领域衡量视觉-语言推理的方式:训练-评估污染、翻译漂移和多项选择题(MCQ)饱和。(1)公开训练池(UGPhysics-Train、SciInstruct、MMK12)在所有六个公开物理评估中通过了单阶段 5-gram Jaccard 审计且零命中;三阶段审计(Jaccard -> mxbai-embed-large 余弦相似度 -> Haiku-4.5 LLM 评判)仅在 SciInstruct 中就发现了 134 个近似重复项和 4,846 个改写候选。(2)在 59 道配对的爱沙尼亚语-英语奥林匹克问题上,Sonnet 4.5 表现出 17 个百分点的差异(30.5% vs. 13.6%;符号检验 p=0.011,McNemar 检验 p=0.021,配对自助法 95% CI [+5.1, +28.9] pp)。(3)在相同的 Sonnet 权重上,MCQ(在 PhyX 上为 79.7%)与开放式奥林匹克评估(在 PhysOlym-A 上为 33.4%)之间存在 46 个百分点的格式与新颖性梯度。我们发布了四个旨在弥补这些差距的产物:PhysCorp-A(6,432 条记录的三阶段审计多模态语料库)、PhysR1Corp(2,268 条记录的闭式强化学习池)、PhysOlym-A(500 道题目、99.8% 新颖来源的留出奥林匹克评估,带有原生难度标签和 EN/ET 双语子集),以及 Physics-R1,一个从 Qwen3-VL-8B-Thinking 冷启动的参考 GSPO+DAPO 方案。在 3 个随机种子下,Physics-R1 在 PhysOlym-A liberal 上将审计语料库较 8B 基座提升了 +18.3 pp(8.0 -> 26.3 +/- 1.7;落后 Sonnet 4.5 7.1 pp),在 PhysReason 上提升 +15.7 pp(23.9 -> 39.6 +/- 6.4;领先 Qwen3-VL-32B 和 Gemini 2.5 Pro),在 OlympiadBench-Physics 上提升 +6.9 pp(46.2 +/- 1.5),在 PhyX MCQ 上提升 +4.1 pp(77.8 +/- 0.3)。
引用
@article{arxiv.2605.14040,
title = {Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning},
author = {Shan Yang},
journal= {arXiv preprint arXiv:2605.14040},
year = {2026}
}
备注
10 pages, 3 tables. Project page: https://shanyang.me/physics-r1-page/