中文

用于几何一致性的定量视频世界模型评估

计算机视觉与模式识别 2026-05-15 v1 人工智能

摘要

生成式视频模型正日益被研究为隐式世界模型,但评估它们是否产生物理上合理的 3D 结构和运动仍具有挑战性。大多数现有视频评估管道严重依赖人类判断或学习型评分器,这些方法主观且对几何失效诊断不够。我们引入了 PDI-Bench(Perspective Distortion Index),一个用于审计生成视频中几何连贯性的定量框架。给定生成的片段,我们通过分割和点跟踪(如 SAM 2、MegaSaM 和 CoTracker3)获取对象中心观察,然后通过单目重建将其提升到 3D 世界空间坐标,计算一组透视几何残差,捕获三个失效维度:尺度-深度对齐、3D 运动一致性和 3D 结构刚性。为支持系统评估,我们构建了 PDI-Dataset,涵盖设计以考验这些几何约束的多样化场景。跨最先进的视频生成器,PDI 揭示了一致几何特定的失效模式,这些失效模式不被常见的感知指标捕获,为向物理基础视频生成和物理世界模型的进步提供了诊断信号。我们的代码和数据集可在 https://pdi-bench.github.io/ 查找。

关键词

引用

@article{arxiv.2605.15185,
  title  = {Quantitative Video World Model Evaluation for Geometric-Consistency},
  author = {Jiaxin Wu and Yihao Pi and Yinling Zhang and Yuheng Li and Xueyan Zou},
  journal= {arXiv preprint arXiv:2605.15185},
  year   = {2026}
}

备注

12 pages, 5 figures. Project page : https://pdi-bench.github.io/