中文

灵巧世界模型

高能物理 - 理论 2026-04-01 v2 代数拓扑 微分几何

摘要

3D 重建的最新进展使得从日常环境中创建逼真的数字孪生体变得轻而易举。然而,当前的数字孪生体仍然是静态的,仅限于导航和视图合成,缺乏具身交互性。为填补这一差距,我们引入了灵巧世界模型(Dexterous World Model, DWM),这是一个场景-动作条件的视频扩散框架,建模了灵巧人类动作如何引起静态 3D 场景中的动态变化。给定一个静态 3D 场景渲染和一个俯瞰手部动作序列,DWM 生成描述人类-场景相互作用的具有时序一致性的视频。我们的做法将视频生成条件化于 (1) 遵循指定相机轨迹的静态场景渲染,以确保空间一致性,和 (2) 编码几何和运动线索的俯瞰手部网格渲染,直接建模动作条件的动态。为训练 DWM,我们构建了一个混合交互视频数据集。合成的俯瞰交互提供了用于联合 locomotion 和操纵学习的完全对齐监督,而固定相机的真实世界视频贡献了多样性和真实感的对象动态。实验表明,DWM 能够实现逼真且在物理上合乎逻辑的交互,包括抓取、开启和移动物体,同时保持相机和场景的一致性。这一框架代表了基于视频扩散的交互式数字孪生体的第一步,使从俯瞰动作实现具身仿真成为可能。

关键词

引用

@article{arxiv.2512.17906,
  title  = {Extra-Dimensional \eta-Invariants and Anomaly Theories},
  author = {Mirjam Cvetič and Ron Donagi and Jonathan J. Heckman and Max Hübner},
  journal= {arXiv preprint arXiv:2512.17906},
  year   = {2026}
}

备注

45 pages + appendix, 4 figures, refs updated, typos fixed