中文

MechVerse:评估视频生成模型中的物理运动一致性

计算机视觉与模式识别 2026-05-15 v1

摘要

基于文本和图像条件的视频生成模型已实现了较高的视觉保真度与时序连贯性,但它们往往无法生成受运动学与几何约束支配的运动。在这些设定下,物体各部分必须保持刚性,与相邻组件保持接触或耦合,并在相连部件间一致地传递运动。这些要求在铰接式机械组件中尤为明确,其运动受刚性连杆几何、接触/耦合关系以及通过运动链的传动所约束。因此,生成的视频可能看起来合理,却违背了预期的机制,例如旋转了本应平移的部件、使刚性组件变形、破坏了部件间的耦合,或未能带动下游组件。为了评估这一差距,我们引入了 MechVerse,一个用于机械一致性图像到视频生成的基准。MechVerse 包含来自 141 个类别的 1,357 个机械组件的 21,156 个合成片段,按运动学复杂度递增分为三个层级:独立铰接、成对耦合和密集耦合多部件机制。每个片段都配有结构化提示,描述了部件标识、固定支撑、运动组件、运动原语、方向、速度/幅度以及部件间依赖关系。我们使用标准视频指标、指令遵循得分以及关于运动正确性和运动学耦合的人类判断,评估了专有的、开源的和微调的图像到视频模型。结果表明,当前模型能够保持外观和平滑度,却无法生成机械上容许的运动,且误差随耦合复杂度的增加而增大。MechVerse 为衡量和改进基于图像与语言输入的机制感知视频生成提供了基准。

关键词

引用

@article{arxiv.2605.14843,
  title  = {MechVerse: Evaluating Physical Motion Consistency in Video Generation Models},
  author = {Rahul Jain and Mayank Patel and Asim Unmesh and Karthik Ramani},
  journal= {arXiv preprint arXiv:2605.14843},
  year   = {2026}
}

备注

Under Review