Embody4D:面向具身 AI 的通用 4D 世界模型
计算机视觉与模式识别
2026-05-05 v1
摘要
世界模型在建模动态环境方面取得了显著进展;然而,大多数具身世界模型仍受限于 2D 表示,缺乏具身空间推理所必需的全景多视角信息。弥合这一差距极具挑战性,主要源于多视角数据稀缺的严重程度、难以在生成的 3D 几何中保持时空一致性,以及倾向于幻觉操纵细节的趋势。为此,本文提出 Embody4D,一个专为具身场景设计的视频到视频世界模型,能够从单眼视频合成任意新视角。首先,为解决数据稀缺问题,引入 3D 感知的构成性合成管道,以构筑异构数据集,将多样化背景上的机器人机械臂进行组合,确保广泛的泛化。其次,为实现几何稳定性,设计了自适应噪声注入策略;通过利用图像区域的置信度差异,该方法在扩散过程中选择性正则化,以确保严格的时空一致性。最后,为保证操纵保真度,融合了交互感知注意力机制,显式关注机器人交互区域。广泛实验表明,Embody4D 实现了最先进的性能,作为一个稳健的世界模型,能够合成高保真、视角一致的视频,以赋能下游机器人规划与学习。
引用
@article{arxiv.2605.01799,
title = {Embody4D: A Generalist 4D World Model for Embodied AI},
author = {Peiyan Tu and Hanxin Zhu and Jingwen Sun and Shaojie Ren and Cong Wang and Jiayi Luo and Xiaoqian Cheng and Zhibo Chen},
journal= {arXiv preprint arXiv:2605.01799},
year = {2026}
}