中文

PhyGround:基准生成式世界模型中的物理推理

计算机视觉与模式识别 2026-05-12 v1 人工智能 机器学习

摘要

生成式世界模型日益用于视频生成,学习的模拟器预期能够捕捉支配真实世界动态的物理规则。然而,评估生成视频是否实际遵循这些规则 remains 挑战。现有的 physics-focused 视频基准取得了重要进展,但仍面临三个关键挑战:评估框架粗糙掩盖特定规则失效、response 偏见和疲劳削弱注释判断的有效性,以及不够 physics-aware 或难以审计的自动评估器。为此,我们引入 PhyGround,一个用于评估视频生成中物理推理的 criteria 导向基准。该基准包含 250 个精选提示,每个提示都增强了预期物理结果,并涵盖固体身体力学、流体力学和光学的 13 种物理法则。每种法则通过可观测子问题实现,以启用 per-law 诊断。我们对八个现代视频生成模型进行大规模、质量受控的人类研究,基于社会科学实验设计。459 名注释者提供了 5,796 项完整注释,超过 37.4K 项细粒度标签;经过质量控制后,保留下来的注释显示出高的 split-half 模型排序相关性(Spearman's rho > 0.90)。为支持可重复的自动评估,我们发布 PhyJudge-9B,一个开源 physics 专门 VLM 仲裁员。PhyJudge-9B 在整体相对偏差上显著低于 Gemini-3.1-Pro(3.3% vs. 16.6%)。我们在项目页面 https://phyground.github.io/ 上发布提示、人类注释、模型检查点和评估代码。

关键词

引用

@article{arxiv.2605.10806,
  title  = {PhyGround: Benchmarking Physical Reasoning in Generative World Models},
  author = {Juyi Lin and Arash Akbari and Yumei He and Lin Zhao and Haichao Zhang and Arman Akbari and Xingchen Xu and Zoe Y. Lu and Enfu Nan and Hokin Deng and Edmund Yeh and Sarah Ostadabbas and Yun Fu and Jennifer Dy and Pu Zhao and Yanzhi Wang},
  journal= {arXiv preprint arXiv:2605.10806},
  year   = {2026}
}

备注

Preprint. 56 pages, 39 figures, 40 tables. Project page: https://phyground.github.io/